タグ: #coding-benchmarks
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
コーディングベンチマークはエージェント時代とズレている — リーダーボードがエージェントを誤って比べる三つの理由
Tessl のチームが 2026 年 6 月に arXiv へ投稿したポジション論文は、今日のコーディングベンチマークがエージェント型のソフトウェアエンジニアリングと根本的にズレていると主張します。ベンチマークは個々のモデルを測るために作られたのに、私たちはそれで、モデル・ハーネス・コンテキスト・環境・フィードバックが絡み合ったシステム全体を比べているからです。論文は三つの具体的なズレ — モデルとハーネスをひとまとめにする点数、単一正
2026-07-11 · 11 分で読めます #ai#agents#evaluation#software-engineering#coding-benchmarksAI コーディングモデルの評価で信号とノイズを見分ける — SWE-bench が揺らいだ理由
OpenAI の評価チームは、最も広く使われるコーディングベンチマークである SWE-bench Verified が、汚染と設計上の欠陥のためにもはや意味のある信号を与えないと指摘します。信号(モデルを見分ける力)とノイズ(実行ごとに揺れる変動)という二つの軸で見直すと、リーダーボードの順位の多くがノイズの上に立っていることが分かります。汚染・ハーネスの差・採点不能な課題・過学習がどのようにスコアを膨らませるかを整理し、チームがコーデ
2026-07-11 · 12 分で読めます #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding