태그: #inference-cost
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가
2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대
2026-07-31 · 19 분 읽기 #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6과 가격 대비 성능의 한계 — 곡선 위에서 내 워크로드의 자리를 찾는 법
OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 1
2026-07-31 · 20 분 읽기 #ai#llm#openai#inference-cost#prompt-cachingDeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스
2026-07-31 · 20 분 읽기 #ai#llm#deepseek#inference-cost#moe