태그: #llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 216 편
500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가
2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대
2026-07-31 · 19 분 읽기 #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6과 가격 대비 성능의 한계 — 곡선 위에서 내 워크로드의 자리를 찾는 법
OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 1
2026-07-31 · 20 분 읽기 #ai#llm#openai#inference-cost#prompt-caching26B 모델을 2GB 램으로 돌리는 원리 — 상주 메모리와 워킹셋은 같은 숫자가 아니다
2026년 7월 29일 Show HN에 올라온 TurboFieldfare는 Gemma 4 26B-A4B를 M 시리즈 맥에서 약 2GB 램으로 돌린다고 주장합니다. 디스크에는 14.3GB가 깔리고, 램에 상주하는 것은 1.35GB짜리 공유 코어뿐이며, 토큰마다 필요한 전문가 가중치를 SSD에서 읽어 옵니다. 이 글은 그 숫자들을 직접 유도해 검증합니다 — 4비트 그룹 64 양자화가 왜 가중치당
2026-07-31 · 20 분 읽기 #ai#llm#quantization#apple-silicon#moe증류로 전이되는 것과 안 되는 것 — DeepSeek을 GPT-OSS에 증류했더니 검열이 따라오지 않았다
2026년 7월 30일 Show HN에 올라온 CTGT의 실험은 DeepSeek V4 Flash를 교사로, GPT-OSS를 학생으로 삼아 금융 추론 능력을 증류했더니 능력은 넘어왔는데 정치 검열은 넘어오지 않았다고 보고합니다. 대응 쌍 152개에서 교사는 민감 질문과 대조군 사이에 45.45점의 검열 격차를 보였지만 학생은 0.43점과 3.94점으로 기준선에 머물렀습니다. 이 글은 그 실험
2026-07-31 · 21 분 읽기 #ai#llm#distillation#alignment#open-weights프롬프트로 3D CAD를 만든다는 것 — 메시와 B-rep, 그리고 제약 조건이라는 병목
GeekNews Show GN에 프롬프트로 3D CAD 모델을 만드는 툴 CAID가 올라왔습니다. 만든 사람이 직접 밝힌 한계가 이 분야 전체의 상태를 정확히 요약합니다 — 치수 자동 검증이 없고, 공차와 DFM과 가공성을 판단하지 못하며, 출력물을 제조에 바로 쓰면 안 된다는 것. 엔지니어링 관점의 질문은 하나입니다. CAD는 파라메트릭이고 제약 기반인데, 메시를 생성하는 것과 편집 가능한
2026-07-31 · 22 분 읽기 #ai#cad#llm#manufacturing#geometry가짜 저자 논문이 구두 발표로 채택됐다 — AI 시대 피어리뷰의 시스템 실패 분석
2026년 7월 30일, 리뷰어 두 명이 이번 여름에 맡은 22편의 ML 학회 투고 중 15편에서 조작된 인용, 실재하지 않는 저자, 또는 명백한 LLM 생성 흔적을 찾았다고 공개했습니다. 그중 두 편은 실재하는 논문의 저자 이름을 가짜로 바꿔 인용했고, 리젝트 의견과 조직위 신고에도 불구하고 "환각 참고문헌만 고치라"는 조건으로 구두 발표에 채택됐습니다. 이 글은 분노가 아니라 시스템 실패
2026-07-31 · 24 분 읽기 #ai#peer-review#research-integrity#llm#academiaDeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스
2026-07-31 · 20 분 읽기 #ai#llm#deepseek#inference-cost#moe사내 지식베이스를 LLM으로 만든다는 것 — 권한 인지 검색, 신선도, 그리고 출시 전 평가셋
Cerebras가 2026년 7월 15일에 공개한 사내 지식베이스 구축기는 하루 15,000건 넘는 질의를 사람과 자동화와 에이전트가 함께 던지는 시스템의 내부 구조를 드러냅니다. 하지만 사내 지식베이스에서 팀이 실제로 과소평가하는 부분은 청킹이나 리랭킹이 아니라 권한, 신선도, 삭제 전파, 그리고 진실 공급원 충돌입니다. HR 문서를 흘리는 검색은 없는 것만 못하고, 이미 폐기한 런북을 자
2026-07-31 · 26 분 읽기 #ai#rag#enterprise-search#llm#platform-engineeringLLM 추론 VRAM 계산법 — 가중치보다 KV 캐시가 먼저 터집니다
"이 모델이 우리 GPU에 올라갑니까"라는 질문에 곱셈 몇 번으로 답하는 방법을 정리했습니다. 가중치 메모리는 파라미터 수 곱하기 바이트로 끝나지만, 실제로 배포를 막는 것은 시퀀스 길이와 배치에 비례해서 자라는 KV 캐시입니다. KV 캐시 공식과 GQA가 이를 몇 분의 일로 줄이는 원리, 프리필 활성화와 프레임워크 오버헤드의 크기, PagedAttention이 없앤 단편화 손실, 그리고 4
2026-07-26 · 21 분 읽기 #llm#inference#vram#kv-cache#quantizationLLM 구조화된 출력 안정화 — 파싱 실패를 없애는 네 겹의 방어
JSON을 달라고 했는데 마크다운 펜스에 싸여 오거나, 뒤에 설명 문장이 붙거나, 토큰 상한에서 잘려 오는 문제를 계층별로 해결하는 방법을 정리했습니다. 실패 유형을 먼저 분류하고, 프롬프트 지시부터 함수 호출 스키마와 제약 디코딩까지 방어를 겹으로 쌓되, 제약 디코딩이 문법적 유효성만 보장하고 의미적 정확성은 보장하지 않는다는 구분을 분명히 합니다. 필드 이름과 순서가 정확도를 바꾸는 이유
2026-07-26 · 20 분 읽기 #llm#structured-output#json-schema#constrained-decoding#validationLLM API 비용 최적화 — 출력 토큰, 프롬프트 캐싱, 라우팅의 손익분기 계산
LLM API 청구서를 절반으로 줄이는 작업은 감이 아니라 산수입니다. 출력 토큰 단가가 입력의 몇 배라는 구조 때문에 가장 큰 레버는 거의 항상 출력 길이 통제이고, 그다음이 프롬프트 캐싱입니다. 캐싱이 접두사만 잡는다는 제약이 프롬프트 배치 순서를 어떻게 강제하는지, RAG와 전체 컨텍스트의 손익분기가 어디인지, 모델 라우팅의 절감률 공식과 그에 따르는 정확도 손실을 어떻게 같은 단위로
2026-07-26 · 20 분 읽기 #llm#cost-optimization#prompt-caching#rag#model-routingRAG가 엉뚱한 답을 할 때 — 검색 실패와 생성 실패를 가르는 디버깅 절차
RAG가 틀린 답을 내면 대부분 프롬프트부터 고치는데, 실제 원인의 다수는 검색 단계에 있습니다. 정답 청크를 손으로 넣어 보는 한 번의 실험으로 검색 실패와 생성 실패를 가르는 절차부터 시작해, 청킹이 왜 가장 흔한 범인인지, 임베딩 유사도가 의미 유사도와 갈라지는 지점과 BM25 혼합이 자주 이기는 이유, 재순위화가 값을 하는 조건, 청크에 문서 제목과 메타데이터를 붙였을 때의 효과를 정
2026-07-26 · 22 분 읽기 #llm#rag#retrieval#chunking#evaluationLLM 평가를 감으로 하지 않는 법 — 표본 크기, 심사자 편향, CI 회귀 테스트
프롬프트를 고치고 "좋아진 것 같다"로 배포하는 팀은 조용히 쌓이는 회귀를 볼 방법이 없습니다. 평가를 어서션, 골든 데이터셋, LLM 심사자, 사람 평가의 네 층위로 나눠 각각의 비용과 신뢰도를 정리하고, 심사자 모델의 위치 편향과 길이 선호를 어떻게 상쇄하는지 다룹니다. 예시 20개로 낸 결론의 신뢰구간이 실제로 얼마나 넓은지 계산하고, 짝지은 비교가 필요 표본을 몇 분의 일로 줄이는지
2026-07-26 · 19 분 읽기 #llm#evaluation#llm-as-judge#statistics#regression-testingRAG · 파인튜닝 · 롱컨텍스트 — 내 문제엔 뭘 써야 하나: 논문이 실제로 잰 것, 그리고 아무도 재지 않은 것
LLM 아키텍처에서 가장 많이 나오는 질문이지만, 대부분의 답은 출처 없는 의사결정 트리입니다. 이 글은 측정된 것만 가지고 답합니다. 파인튜닝은 새 지식을 넣는 데 실패한다는 것이 여러 논문에서 반복 측정됐고(Ovadia 등, Gekhman 등), 정반대로 보이는 농업 사례 연구는 사실 다른 개입(비지도 계속사전학습 vs 지도 Q&A 튜닝)을 잰 것이라 충돌이 아닙니다. 롱컨텍스트는 위치·
2026-07-17 · 43 분 읽기 #rag#llm#fine-tuning#long-context#aiLLM API 비용을 실제로 줄이는 법 — "캐싱 90% 할인"이 청구서에서는 왜 25%인가
프롬프트 캐싱의 캐시 읽기는 입력 가격의 10분의 1입니다. 그런데 그게 청구서를 90% 깎아 주지는 않습니다. Anthropic이 자기 문서에 올려 둔 계산 예제를 그대로 따라가면, 캐시가 완전히 걸린 상태에서도 총액은 0.705달러에서 0.525달러로 25.5%만 줄어듭니다. 이유는 단순합니다 — 할인은 그 항목에 쓰는 돈의 비율만큼만 청구서를 줄이고, 출력 토큰이 이미 비용의 60%를
2026-07-17 · 39 분 읽기 #llm#cost-optimization#prompt-caching#api#ai컨텍스트 엔지니어링은 프롬프트 엔지니어링을 대체한 말인가 — 측정된 것과 아닌 것
"프롬프트 엔지니어링은 죽었다"는 문장은 이 용어를 만든 어느 1차 출처에도 없습니다. Karpathy는 few-shot 예제와 태스크 설명을 컨텍스트 엔지니어링의 구성요소로 나열했고, Anthropic은 "프롬프트 엔지니어링의 자연스러운 진전(natural progression)"이라고 썼습니다. 즉 대체가 아니라 포함입니다. 그런데도 이게 진짜 다른 일이라는 근거는 있습니다 — Chrom
2026-07-17 · 37 분 읽기 #llm#context-engineering#prompt-engineering#long-context#ai-agentAI 에이전트의 메모리는 실제로 어떻게 만드는가 — 네 가지 설계와, 벤치마크가 실제로 증명한 것
"에이전트 메모리"는 한 가지 기술이 아니라 최소 네 가지 서로 다른 설계를 뭉뚱그린 말입니다 — 파일 스크래치패드, 요약/컴팩션, 벡터 회수, 지식 그래프. 이 글은 각각이 실제로 무엇을 하는지 제품 문서로 확인하고, 그다음 훨씬 불편한 질문을 던집니다: 어느 쪽이 낫다는 근거가 실제로 측정된 적이 있나? Mem0 논문(arXiv:2504.19413)의 표를 직접 읽어 보면, 헤드라인인 "
2026-07-17 · 38 분 읽기 #ai#ai-agent#agent-memory#llm#benchmark로컬에서 LLM 돌리려면 VRAM이 얼마나 필요한가 — 표 말고 공식으로 계산하기
"8B 모델에 몇 GB 필요한가요"의 정답은 표가 아니라 두 개의 공식입니다. 가중치는 파라미터 수 곱하기 bpw 나누기 8이고, KV 캐시는 2 곱하기 레이어 수 곱하기 KV 헤드 수 곱하기 headdim 곱하기 바이트 수 곱하기 토큰 수입니다. 이 글은 두 공식을 llama.cpp 소스와 공식 표에 직접 대조해 검증합니다 — ggml 블록 구조체에서 유도한 Q80의 8.5 bpw는 lla
2026-07-17 · 43 분 읽기 #llm#quantization#kv-cache#local-llm#gpu시뮬레이션된 고객은 절대 떠나지 않는다 — LLM 유저 시뮬레이터가 에이전트 점수를 부풀리는 지점
τ-bench 계열의 대화형 에이전트 벤치마크에서 "사용자" 역할은 또 다른 LLM이 맡습니다. 그런데 이 시뮬레이터는 측정 대상이 아니라 측정 도구이고, 도구는 교정을 받아야 합니다. 2026년에 나온 세 편의 검증 연구는 같은 방향을 가리킵니다 — 시뮬레이션된 사용자는 너무 협조적입니다. 실제 사람 451명으로 τ-bench 프로토콜을 그대로 돌린 연구는 시뮬레이터가 만드는 "이지 모드"
2026-07-16 · 41 분 읽기 #ai#llm#evaluation#agents#simulationPD 분리는 처리량을 늘리지 않는다 — 프리필/디코드 분리가 실제로 사는 것
프리필과 디코드를 다른 GPU로 쪼개는 PD 분리는 2026년 vLLM·SGLang·TensorRT-LLM에 모두 들어온 설계지만, 어디를 봐도 "2배에서 7배"라는 숫자만 돌아다닙니다. 그런데 vLLM 공식 문서는 같은 기능을 두고 "분리 프리필은 처리량을 개선하지 않는다"고 대문자로 못 박아 두었습니다. 둘 다 맞습니다 — 그 벤더 숫자들은 전부 처리량이 아니라 goodput(SLO를 지
2026-07-16 · 30 분 읽기 #llm#ai#inference#kv-cache#vllm