タグ: #llm-as-judge
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
評価者のボトルネック — 弱い採点者がシステム全体の上限になります
ハーネスをどれだけ直してもスコアが動かないなら、ボトルネックはハーネスではなく評価者かもしれません。測定できない品質は選択できず、だから弱い採点者がシステム全体の上限になります。ハーネスエンジニアリング連載第5回では、スモークテストからユニットテスト、ルーブリック、採点データの隔離、牽制指標のパネルまで、評価者のはしごと、評価の較正を先にすべき理由を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트評価駆動開発で最初に較正すべきなのは審査者です
Airbnbエンジニアリングが2026年7月に公開した評価駆動開発の振り返りは、評価セットを先に書けという話ではなく、採点する側のモデルがまず計測器として認められなければならないという話に近いものです。この記事は、審査者モデルをゴールデンセット50〜100件で較正する手順、一致度を単純な正確度ではなくカッパで測るべき理由、そして較正されていない審査者がどうやってチーム全体を誤った方向へ最適化させてしまうのかを、実行可能なコードとともに整
2026-08-09 · 16 分で読めます #ai#llm#eval-driven-development#llm-as-judge#evaluationテキスト・画像・エージェントをそれぞれどう測るか — 三つの領域の測定が根本的に違う理由
テキスト・画像・エージェントは同じ「性能」という言葉を使いますが、測定の構造はまったく異なります。テキストは正解があるふりをした選択式と、正解のない生成式に分かれ、画像は分布距離と人間の判断がずれ、エージェントは部分成功・環境状態・非決定性のためにそもそも一つの数字に圧縮できません。この記事は各領域の代表的な指標が実際に何を計算しているのかを定義のレベルで分解し、領域ごとに「指標は高いのに実際には悪い」事例を一つずつ添えました。最後に領
2026-08-02 · 37 分で読めます #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metricsLLM評価を勘でやらない方法 — 標本サイズ、審査者バイアス、CI回帰テスト
プロンプトを直して「良くなった気がする」でデプロイするチームには、静かに積み上がる回帰を見る方法がありません。評価をアサーション、ゴールデンデータセット、LLM-as-judge、人手評価の四層に分けてそれぞれのコストと信頼度を整理し、審査者モデルの位置バイアスと長さ選好をどう相殺するかを扱います。例20個で出した結論の信頼区間が実際どれだけ広いのかを計算し、ペア比較が必要標本を何分の一に減らすのかをコードで示します。温度0でも完全には
2026-07-26 · 20 分で読めます #llm#evaluation#llm-as-judge#statistics#regression-testingチャットボット評価体系構築ガイド:LLM-as-Judge・RAGAS・自動化テストパイプライン
LLMベースチャットボットの品質評価体系を体系的に構築する方法を扱います。RAGASフレームワークを活用したRAGパイプライン評価、LLM-as-Judgeパターン、自動化テストパイプライン構築、プロダクションモニタリングまで実践ガイドを提供します。
2026-03-10 · 27 分で読めます #chatbot#evaluation#ragas#llm-as-judge#testing