タグ: #regression-testing
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
ハーネス指紋とバージョン管理 — 記録なき変更を追跡可能にする
プロンプトのコミットもモデル変更もないのに成功率が動いたなら、何をロールバックすべきでしょうか。ハーネスエンジニアリング連載第7回は、ハーネスを構成するすべての決定を正規化したハッシュひとつに要約するハーネス指紋を扱います。指紋に何を入れて何を外すか、なぜ指紋が同じでなければ比較が成立しないのか、そして指紋の履歴でリグレッションを二分探索してロールバックする方法まで整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트自社サービス向け評価セットを作る — トラフィック収集から統計的有意性の判定まで
公開ベンチマークは自社の課題を代わりに測ってはくれません。入力分布も、正解の定義も、失敗のコスト構造も違うからです。この記事では、実トラフィックから事例を拾い上げて失敗タイプ別に層化し、正解を定義できないタスクにルーブリックをかぶせ、採点スクリプトを組み込む過程を実際のコードで追います。何件あれば十分かを信頼区間で感覚的につかむ方法から、小さな評価セットで二つのモデルの5パーセントポイント差が統計的に意味を持つかをMcNemar検定とブ
2026-08-02 · 37 分で読めます #llm-evaluation#eval-set#rubric#statistics#regression-testingLLM評価を勘でやらない方法 — 標本サイズ、審査者バイアス、CI回帰テスト
プロンプトを直して「良くなった気がする」でデプロイするチームには、静かに積み上がる回帰を見る方法がありません。評価をアサーション、ゴールデンデータセット、LLM-as-judge、人手評価の四層に分けてそれぞれのコストと信頼度を整理し、審査者モデルの位置バイアスと長さ選好をどう相殺するかを扱います。例20個で出した結論の信頼区間が実際どれだけ広いのかを計算し、ペア比較が必要標本を何分の一に減らすのかをコードで示します。温度0でも完全には
2026-07-26 · 20 分で読めます #llm#evaluation#llm-as-judge#statistics#regression-testing