タグ: #signal-vs-noise
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
AI コーディングモデルの評価で信号とノイズを見分ける — SWE-bench が揺らいだ理由
OpenAI の評価チームは、最も広く使われるコーディングベンチマークである SWE-bench Verified が、汚染と設計上の欠陥のためにもはや意味のある信号を与えないと指摘します。信号(モデルを見分ける力)とノイズ(実行ごとに揺れる変動)という二つの軸で見直すと、リーダーボードの順位の多くがノイズの上に立っていることが分かります。汚染・ハーネスの差・採点不能な課題・過学習がどのようにスコアを膨らませるかを整理し、チームがコーデ
2026-07-11 · 12 分で読めます #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding