タグ: #swe-bench
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
AI コーディングモデルの評価で信号とノイズを見分ける — SWE-bench が揺らいだ理由
OpenAI の評価チームは、最も広く使われるコーディングベンチマークである SWE-bench Verified が、汚染と設計上の欠陥のためにもはや意味のある信号を与えないと指摘します。信号(モデルを見分ける力)とノイズ(実行ごとに揺れる変動)という二つの軸で見直すと、リーダーボードの順位の多くがノイズの上に立っていることが分かります。汚染・ハーネスの差・採点不能な課題・過学習がどのようにスコアを膨らませるかを整理し、チームがコーデ
2026-07-11 · 12 分で読めます #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingコードがエージェントの実行基盤になる: code-as-harness の視点
コードを単なる LLM の最終成果物ではなく、エージェントが環境とやり取りする実行基盤(harness)として捉え直します。検証ループ、ツール呼び出し、実行フィードバックを中心に、エージェント設計パターンと落とし穴を整理します。
2026-06-25 · 33 分で読めます #ai#agentic-coding#llm-agents#tool-calling#reactAIエージェント & LLM ベンチマーク 2026 — SWE-bench Verified / ARC-AGI 2 / GAIA / MMLU-Pro / GPQA / LiveCodeBench / Chatbot Arena 徹底ガイド
2026年現在、本当に意味のある30以上のAIベンチマークを一枚に整理する。SWE-bench / SWE-bench Verified / SWE-bench MultimodalからAgentBench・WebArena・GAIA、ARC-AGI 2(シャンポレの100万ドル賞金)、RE-Bench(METR)、Frontier Math(Epoch AI)、HumanEval / MBPP / LiveCodeBench、MMLU
2026-05-16 · 30 分で読めます #ai-benchmark#llm-evaluation#swe-bench#swe-bench-verified#agentbench