タグ: #agent-benchmark
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
テキスト・画像・エージェントをそれぞれどう測るか — 三つの領域の測定が根本的に違う理由
テキスト・画像・エージェントは同じ「性能」という言葉を使いますが、測定の構造はまったく異なります。テキストは正解があるふりをした選択式と、正解のない生成式に分かれ、画像は分布距離と人間の判断がずれ、エージェントは部分成功・環境状態・非決定性のためにそもそも一つの数字に圧縮できません。この記事は各領域の代表的な指標が実際に何を計算しているのかを定義のレベルで分解し、領域ごとに「指標は高いのに実際には悪い」事例を一つずつ添えました。最後に領
2026-08-02 · 37 分で読めます #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics