태그: #signal-vs-noise
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
AI 코딩 모델 평가에서 신호와 잡음 가려내기 — SWE-bench가 흔들리는 이유
OpenAI 평가팀은 가장 널리 쓰이는 코딩 벤치마크인 SWE-bench Verified가 오염과 설계 결함 탓에 더 이상 의미 있는 신호를 주지 못한다고 밝혔습니다. 신호(모델을 가려내는 힘)와 잡음(실행마다 흔들리는 변동)이라는 두 축으로 다시 보면, 리더보드 순위의 상당수가 잡음 위에 서 있습니다. 오염·하네스 차이·채점 불가능한 과제·과적합이 어떻게 점수를 부풀리는지 정리하고, 팀이
2026-07-11 · 12 분 읽기 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding