タグ: #benchmarks
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationAI コーディングモデルの評価で信号とノイズを見分ける — SWE-bench が揺らいだ理由
OpenAI の評価チームは、最も広く使われるコーディングベンチマークである SWE-bench Verified が、汚染と設計上の欠陥のためにもはや意味のある信号を与えないと指摘します。信号(モデルを見分ける力)とノイズ(実行ごとに揺れる変動)という二つの軸で見直すと、リーダーボードの順位の多くがノイズの上に立っていることが分かります。汚染・ハーネスの差・採点不能な課題・過学習がどのようにスコアを膨らませるかを整理し、チームがコーデ
2026-07-11 · 12 分で読めます #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingLLM評価プロダクションガイド:MMLUベンチマークからカスタム評価パイプラインまで
MMLUやHumanEvalなどの主要ベンチマークの理解から、カスタム評価パイプラインの構築、統計的有意性検定、CI/CD自動評価ワークフロー、プロダクション監視戦略まで、LLM評価を網羅的に解説する実践ガイドです。
2026-03-07 · 27 分で読めます #llm#evaluation#benchmarks#mmlu#humaneval