タグ: #llm-evaluation
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
集めたあと — Langfuseのダッシュボード、メトリクスAPI、そしてトレースに付く評価
トレースを集めることと、そのトレースから答えを得ることは別の仕事です。本記事はLangfuseが提供する指標の軸は何で、それをどの次元で切って見るべきかを整理したうえで、メトリクスAPI v2の問い合わせ構造を実際のリクエストの形で確認します。v4でtracesビューが姿を消しobservations中心に再編された変化、scoreがtrace・observation・session・データセット実行の四か所に付く仕組み、評価器がtra
2026-08-14 · 16 分で読めます #observability#langfuse#llm-evaluation#metrics-api#dashboardLLMベンチマークツールを分解する — 同じMMLUがハーネスごとに違うスコアを出す理由
ベンチマークのスコアはモデルの属性ではなく、特定の条件下で行われた測定の結果です。同じLLaMA 65Bが同じMMLUで63.6点と48.8点を同時に取った事件は、ハーネスがプロンプトをどう組み立て、正解をどうパースするかがスコアのかなりの部分を決めることを示しています。この記事は評価ハーネスが内部で実際に行っている六つの段階を分解し、lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI
2026-08-02 · 35 分で読めます #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility自社サービス向け評価セットを作る — トラフィック収集から統計的有意性の判定まで
公開ベンチマークは自社の課題を代わりに測ってはくれません。入力分布も、正解の定義も、失敗のコスト構造も違うからです。この記事では、実トラフィックから事例を拾い上げて失敗タイプ別に層化し、正解を定義できないタスクにルーブリックをかぶせ、採点スクリプトを組み込む過程を実際のコードで追います。何件あれば十分かを信頼区間で感覚的につかむ方法から、小さな評価セットで二つのモデルの5パーセントポイント差が統計的に意味を持つかをMcNemar検定とブ
2026-08-02 · 37 分で読めます #llm-evaluation#eval-set#rubric#statistics#regression-testingテキスト・画像・エージェントをそれぞれどう測るか — 三つの領域の測定が根本的に違う理由
テキスト・画像・エージェントは同じ「性能」という言葉を使いますが、測定の構造はまったく異なります。テキストは正解があるふりをした選択式と、正解のない生成式に分かれ、画像は分布距離と人間の判断がずれ、エージェントは部分成功・環境状態・非決定性のためにそもそも一つの数字に圧縮できません。この記事は各領域の代表的な指標が実際に何を計算しているのかを定義のレベルで分解し、領域ごとに「指標は高いのに実際には悪い」事例を一つずつ添えました。最後に領
2026-08-02 · 37 分で読めます #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metricsAI コーディングモデルの評価で信号とノイズを見分ける — SWE-bench が揺らいだ理由
OpenAI の評価チームは、最も広く使われるコーディングベンチマークである SWE-bench Verified が、汚染と設計上の欠陥のためにもはや意味のある信号を与えないと指摘します。信号(モデルを見分ける力)とノイズ(実行ごとに揺れる変動)という二つの軸で見直すと、リーダーボードの順位の多くがノイズの上に立っていることが分かります。汚染・ハーネスの差・採点不能な課題・過学習がどのようにスコアを膨らませるかを整理し、チームがコーデ
2026-07-11 · 12 分で読めます #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingAIエージェント & LLM ベンチマーク 2026 — SWE-bench Verified / ARC-AGI 2 / GAIA / MMLU-Pro / GPQA / LiveCodeBench / Chatbot Arena 徹底ガイド
2026年現在、本当に意味のある30以上のAIベンチマークを一枚に整理する。SWE-bench / SWE-bench Verified / SWE-bench MultimodalからAgentBench・WebArena・GAIA、ARC-AGI 2(シャンポレの100万ドル賞金)、RE-Bench(METR)、Frontier Math(Epoch AI)、HumanEval / MBPP / LiveCodeBench、MMLU
2026-05-16 · 30 分で読めます #ai-benchmark#llm-evaluation#swe-bench#swe-bench-verified#agentbench