태그: #ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 220 편
같은 회사 두 프로젝트가 AI 기여에 정반대 결론을 낸 이유
OpenJDK는 2026년 4월에 생성형 AI로 만든 기여를 전면 금지했고, 같은 오라클 산하의 GraalVM은 같은 시기에 AI 코딩 어시스턴트 사용을 명시적으로 허용했습니다. 두 프로젝트는 같은 기여자 협약을 씁니다. 이 글은 세 문서를 나란히 놓고 읽습니다. OpenJDK 원문, GraalVM의 정책 파일, 그리고 둘 다 참고한 리눅스 커널 문서입니다. 결론은 이 차이가 AI에 대한 태
2026-08-09 · 14 분 읽기 #culture#open-source#ai#policy#code-review코드가 어려운 부분이 아니었다는 말이 왜 그렇게 화를 돋우는가
2026년 8월에 Hacker News 상단을 차지한 에세이 하나는 코드는 원래 어려운 부분이 아니었다는 말이 모든 프로그래머에 대한 모욕이라고 주장합니다. 이 글은 그 반박에 동의하되 이유를 다르게 봅니다. 그 문장이 화를 돋우는 것은 틀려서가 아니라 코드라는 단어의 의미를 도중에 바꿔치기하기 때문입니다. 코드를 세 층으로 쪼개면 양쪽 주장이 각각 어디서 참인지가 보이고, 우리 팀이 실제로
2026-08-09 · 14 분 읽기 #career#craft#ai#engineering-culture#skillsLLM이 못 하는 것은 증명이 아니라 전제를 세우는 일입니다
ICML 2026 입장 논문 Position: LLMs can not jump은 생성형 AI가 귀납을 마스터했고 연역을 빠르게 정복하는 중이지만, 새로운 설명 가설을 만들어 내는 귀추에는 구조적으로 도달하지 못한다고 주장합니다. 이 글은 그 주장을 요약하는 대신, 그것이 사실이라고 가정했을 때 우리가 지금 만드는 시스템의 설계를 어떻게 바꿔야 하는지를 다룹니다. 가설 공간을 어디서 공급할 것
2026-08-09 · 14 분 읽기 #ai#llm#reasoning#abduction#research평가 주도 개발에서 가장 먼저 보정해야 하는 것은 심사자입니다
Airbnb 엔지니어링이 2026년 7월에 공개한 평가 주도 개발 회고는 평가셋을 먼저 쓰라는 이야기가 아니라, 채점하는 모델부터 계측기로 인정받아야 한다는 이야기에 가깝습니다. 이 글은 심사자 모델을 골든셋 50~100개로 보정하는 절차, 일치도를 단순 정확도가 아니라 카파로 재야 하는 이유, 그리고 보정되지 않은 심사자가 어떻게 팀 전체를 잘못된 방향으로 최적화시키는지를 실행 가능한 코드
2026-08-09 · 15 분 읽기 #ai#llm#eval-driven-development#llm-as-judge#evaluation마찰이 사라지면 안목이 남는 게 아니라 안목을 기를 길이 사라집니다
2026년 8월에 화제가 된 에세이 Taste Is All That Is Left는 만드는 일이 싸지면서 무엇을 만들 가치가 있는지 판단하는 능력만 희소해졌다고 말합니다. 이 글은 그 진단에 동의하면서 한 걸음 더 들어갑니다. 안목은 노력이라는 필터의 부산물이었고, 필터가 사라지면 안목이 자동으로 남는 것이 아니라 안목을 기르던 경로가 함께 사라집니다. 그래서 필요한 것은 마찰을 의도적으로
2026-08-09 · 13 분 읽기 #career#craft#ai#code-review#mentoring맡기면서 잃는 것 — 자동화가 실력을 깎는 방식은 균일하지 않습니다
계산기를 쓰면서 죄책감을 느끼는 사람은 없는데, AI가 써 준 문서를 보낸 뒤에는 대부분 조금 찜찜해합니다. 그 비대칭이 이 글의 질문입니다. 오프로딩이 순수한 이득인 영역, 실제로 능력을 깎는다고 측정된 영역, 그리고 지금 대부분의 지식노동이 놓여 있는 애매한 중간을 나눠 봅니다. 항공 분야의 자동화 의존 연구는 통념과 다른 것을 발견했고, 자동화 편향 연구는 훈련으로 막히지 않는다고 말합
2026-08-02 · 26 분 읽기 #humanities#ai#cognition#automation#skill기계가 주는 위로는 진짜인가 — 질문을 바꿔야 하는 이유
사람들은 실제로 AI와 대화한 뒤 기분이 나아집니다. 그걸 착각이라고 잘라 말하는 것은 무례할 뿐 아니라 부정확합니다. 이 글은 반응성이 왜 돌봄처럼 느껴지는지, 챗봇 기반 정신건강 연구가 실제로 무엇을 보여 주고 무엇을 보여 주지 못하는지 임상시험 설계까지 들여다봅니다. 그리고 진짜 질문은 "이 위로가 진짜인가"가 아니라 "무엇을 대체하고 있는가"라고 제안합니다. 보완재로서의 위로와 대체재
2026-08-02 · 27 분 읽기 #humanities#ai#psychology#loneliness#relationships도구인가, 상대인가 — 의식 질문을 미뤄 두고도 할 수 있는 이야기
사람들이 AI 앞에서 가장 먼저 집어 드는 질문은 "이것에 의식이 있는가"입니다. 가장 어려운 질문이고, 아마 가장 쓸모 있는 질문은 아닙니다. 이 글은 그 질문을 닫지 않은 채로 옆에 두고, 관찰 가능한 것부터 시작합니다. 도구가 문장으로 답하기 시작했을 때 무엇이 달라졌는지, 의인화가 왜 시스템이 아니라 우리에 대한 사실인지, 엘리자 효과가 보여 주는 것과 보여 주지 않는 것이 무엇인지,
2026-08-02 · 26 분 읽기 #humanities#ai#philosophy#cognition#technology500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가
2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대
2026-07-31 · 19 분 읽기 #ai#llm#fine-tuning#reinforcement-learning#inference-cost리팩터링의 경제학, 언제 비용이 회수되나 — 변경 빈도로 계산하는 법
2026년 7월 30일 martinfowler.com에 올라온 The Economic Benefit of Refactoring은 1만 7천 줄짜리 모듈을 15단계에 걸쳐 리팩터링하면서, 같은 변경 요청을 매번 다시 돌려 입력 토큰이 159,564개에서 27,360개로 83퍼센트 줄어드는 것을 측정했습니다. 흥미로운 실험이지만 저자 스스로 단일 실험이자 그린필드 앱 하나라고 못 박습니다. 이
2026-07-31 · 27 분 읽기 #refactoring#engineering#technical-debt#ai#metricsGPT-5.6과 가격 대비 성능의 한계 — 곡선 위에서 내 워크로드의 자리를 찾는 법
OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 1
2026-07-31 · 20 분 읽기 #ai#llm#openai#inference-cost#prompt-caching26B 모델을 2GB 램으로 돌리는 원리 — 상주 메모리와 워킹셋은 같은 숫자가 아니다
2026년 7월 29일 Show HN에 올라온 TurboFieldfare는 Gemma 4 26B-A4B를 M 시리즈 맥에서 약 2GB 램으로 돌린다고 주장합니다. 디스크에는 14.3GB가 깔리고, 램에 상주하는 것은 1.35GB짜리 공유 코어뿐이며, 토큰마다 필요한 전문가 가중치를 SSD에서 읽어 옵니다. 이 글은 그 숫자들을 직접 유도해 검증합니다 — 4비트 그룹 64 양자화가 왜 가중치당
2026-07-31 · 20 분 읽기 #ai#llm#quantization#apple-silicon#moe증류로 전이되는 것과 안 되는 것 — DeepSeek을 GPT-OSS에 증류했더니 검열이 따라오지 않았다
2026년 7월 30일 Show HN에 올라온 CTGT의 실험은 DeepSeek V4 Flash를 교사로, GPT-OSS를 학생으로 삼아 금융 추론 능력을 증류했더니 능력은 넘어왔는데 정치 검열은 넘어오지 않았다고 보고합니다. 대응 쌍 152개에서 교사는 민감 질문과 대조군 사이에 45.45점의 검열 격차를 보였지만 학생은 0.43점과 3.94점으로 기준선에 머물렀습니다. 이 글은 그 실험
2026-07-31 · 21 분 읽기 #ai#llm#distillation#alignment#open-weights프롬프트로 3D CAD를 만든다는 것 — 메시와 B-rep, 그리고 제약 조건이라는 병목
GeekNews Show GN에 프롬프트로 3D CAD 모델을 만드는 툴 CAID가 올라왔습니다. 만든 사람이 직접 밝힌 한계가 이 분야 전체의 상태를 정확히 요약합니다 — 치수 자동 검증이 없고, 공차와 DFM과 가공성을 판단하지 못하며, 출력물을 제조에 바로 쓰면 안 된다는 것. 엔지니어링 관점의 질문은 하나입니다. CAD는 파라메트릭이고 제약 기반인데, 메시를 생성하는 것과 편집 가능한
2026-07-31 · 22 분 읽기 #ai#cad#llm#manufacturing#geometryGCC의 AI 정책과 오픈소스의 선택 — 15줄이라는 경계선은 무엇을 지키려는 것인가
2026년 7월 29일 GCC 운영위원회가 AI 정책 작업 그룹의 권고안을 받아들였습니다. 핵심은 법적으로 유의미한 기여에 LLM 생성 콘텐츠가 포함되거나 그로부터 파생된 경우 받지 않는다는 것이고, 그 기준선은 GNU 유지보수자 지침의 약 15줄입니다. 다만 테스트 케이스는 예외이고, 연구·분석·버그 발견·패치 리뷰에 LLM을 쓰는 것 자체는 막지 않으며, AI 보조 작업에는 Assiste
2026-07-31 · 23 분 읽기 #ai#open-source#gcc#licensing#governance가짜 저자 논문이 구두 발표로 채택됐다 — AI 시대 피어리뷰의 시스템 실패 분석
2026년 7월 30일, 리뷰어 두 명이 이번 여름에 맡은 22편의 ML 학회 투고 중 15편에서 조작된 인용, 실재하지 않는 저자, 또는 명백한 LLM 생성 흔적을 찾았다고 공개했습니다. 그중 두 편은 실재하는 논문의 저자 이름을 가짜로 바꿔 인용했고, 리젝트 의견과 조직위 신고에도 불구하고 "환각 참고문헌만 고치라"는 조건으로 구두 발표에 채택됐습니다. 이 글은 분노가 아니라 시스템 실패
2026-07-31 · 24 분 읽기 #ai#peer-review#research-integrity#llm#academiaBun의 Zig to Rust 재작성 11일 — AI 대규모 마이그레이션에서 실제로 옮겨 갈 수 있는 것
Bun이 53만 5천 줄의 Zig 코드를 11일 만에 Rust로 옮긴 과정을 1차 소스로 따라갑니다. 2026년 5월 3일부터 14일까지, 최대 64개의 Claude 인스턴스와 약 50개의 워크플로, 6,502개의 커밋, API 정가 기준 약 16만 5천 달러가 들었습니다. 이 글이 관심 있는 것은 11일이라는 숫자가 아니라 그 숫자를 가능하게 한 조건입니다 — 언어에 독립적인 테스트 스위트
2026-07-31 · 23 분 읽기 #ai#bun#rust#migration#testingAI가 6월 한 달에 2년치 크롬 버그를 잡은 방법 — 1,072개라는 숫자를 읽는 법
구글이 2026년 7월 30일 발표한 내용에 따르면 6월에 나온 크롬 149와 150 두 버전에서만 1,072개의 보안 버그를 고쳤고, 이는 지난 2년간 23개 마일스톤에서 고친 1,036개를 넘습니다. 13년간 살아 있던 샌드박스 탈출 버그도 여기서 나왔습니다. 이 글은 헤드라인 대신 메커니즘을 봅니다 — 2023년 LLM 기반 퍼즈 타깃 생성에서 2024년 Naptime, 2025년 Bi
2026-07-31 · 23 분 읽기 #ai#security#chrome#fuzzing#vulnerabilityAI 에이전트를 프로덕션에서 운영한다는 것 — 멱등성, 예산, 그리고 확신에 찬 오답
에이전트를 프로토타입에서 프로덕션으로 옮길 때 늦게 발견되는 운영 표면이 있습니다. 재시도된 도구 호출의 멱등성, 예산과 스텝 한도, 비결정적 제어 흐름의 관측 가능성, 도구별 권한 경계, 그리고 에이전트가 확신에 차서 틀렸을 때의 에스컬레이션 경로입니다. 최근 GeekNews Ask GN에 올라온 분석은 벤치마크 트레이스 6,780건에서 중복 도구 실행 8,042건을 찾았고, 그중 159건
2026-07-31 · 29 분 읽기 #ai#agents#observability#reliability#mcpGemini Robotics 2와 로봇 파운데이션 모델 — 전신 제어가 실제로 바꾸는 것
2026년 7월 30일 Google DeepMind가 Gemini Robotics 2를 공개하면서 휴머노이드의 발끝부터 손끝까지를 하나의 비전-언어-행동 모델로 제어한다고 발표했습니다. 함께 공개된 숫자는 흥미롭게도 자랑이 아니라 현재 상태의 정직한 기록에 가깝습니다 — 전구를 푸는 데 92퍼센트, 끼우는 데 36퍼센트, 바닥에서 물건을 집는 데 45.7퍼센트. 이 글은 VLA가 실제로 무엇
2026-07-31 · 26 분 읽기 #ai#robotics#vla#foundation-models#evaluation