タグ: #rubric
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
自社サービス向け評価セットを作る — トラフィック収集から統計的有意性の判定まで
公開ベンチマークは自社の課題を代わりに測ってはくれません。入力分布も、正解の定義も、失敗のコスト構造も違うからです。この記事では、実トラフィックから事例を拾い上げて失敗タイプ別に層化し、正解を定義できないタスクにルーブリックをかぶせ、採点スクリプトを組み込む過程を実際のコードで追います。何件あれば十分かを信頼区間で感覚的につかむ方法から、小さな評価セットで二つのモデルの5パーセントポイント差が統計的に意味を持つかをMcNemar検定とブ
2026-08-02 · 37 分で読めます #llm-evaluation#eval-set#rubric#statistics#regression-testing