タグ: #statistics
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
自社サービス向け評価セットを作る — トラフィック収集から統計的有意性の判定まで
公開ベンチマークは自社の課題を代わりに測ってはくれません。入力分布も、正解の定義も、失敗のコスト構造も違うからです。この記事では、実トラフィックから事例を拾い上げて失敗タイプ別に層化し、正解を定義できないタスクにルーブリックをかぶせ、採点スクリプトを組み込む過程を実際のコードで追います。何件あれば十分かを信頼区間で感覚的につかむ方法から、小さな評価セットで二つのモデルの5パーセントポイント差が統計的に意味を持つかをMcNemar検定とブ
2026-08-02 · 37 分で読めます #llm-evaluation#eval-set#rubric#statistics#regression-testingダニング=クルーガー効果 — あの有名なグラフは元論文に存在しません
ネットで出回っている「愚かさの山」のグラフは、ダニングとクルーガーの1999年論文のどこにも存在しません。元論文はコーネル大学の学部生にユーモア、論理、文法の課題を課し、成績四分位ごとに自己評価を比べた4つの研究であり、実際の結果は下位層の過大評価と同じくらい上位層の過小評価を示しています。さらに痛い指摘は別にあります。自己評価と実際の成績にまったく関係のない乱数を入れても、まったく同じ形のグラフが描けてしまうのです。平均への回帰がつく
2026-07-26 · 18 分で読めます #psychology#paper-review#metacognition#self-assessment#statisticsLLM評価を勘でやらない方法 — 標本サイズ、審査者バイアス、CI回帰テスト
プロンプトを直して「良くなった気がする」でデプロイするチームには、静かに積み上がる回帰を見る方法がありません。評価をアサーション、ゴールデンデータセット、LLM-as-judge、人手評価の四層に分けてそれぞれのコストと信頼度を整理し、審査者モデルの位置バイアスと長さ選好をどう相殺するかを扱います。例20個で出した結論の信頼区間が実際どれだけ広いのかを計算し、ペア比較が必要標本を何分の一に減らすのかをコードで示します。温度0でも完全には
2026-07-26 · 20 分で読めます #llm#evaluation#llm-as-judge#statistics#regression-testing工業数学シリーズ 第24回:数値解析、最適化、グラフ、確率と統計のロードマップ
工業数学シリーズの最初のサイクルを締めくくりながら、数値解析、最適化、グラフ、確率と統計がなぜ重要かと、今後どのような順序で勉強すれば良いかを整理します。
2026-03-19 · 8 分で読めます #engineering-math#numerical-methods#optimization#probability#statisticsAI/ML数学基礎完全ガイド:線形代数・微積分・確率論・情報理論
AI/MLを理解するために必要な数学の核心を完全網羅。線形代数(ベクトル、行列、固有値)、微積分(偏微分、連鎖律)、確率統計(分布、MLE、ベイズ)を直感的な解説とともに学ぶ。
2026-03-17 · 30 分で読めます #mathematics#linear-algebra#calculus#probability#statisticsAI のための数学完全ガイド — 線形代数から情報理論まで
AI/ディープラーニングに必要な数学をコードと直感で整理します。線形代数(行列、固有値)、微積分(偏微分、逆伝播)、確率/統計(ベイズ、分布)、最適化(勾配降下法)、情報理論(エントロピー、KLダイバージェンス)まで。
2026-03-02 · 17 分で読めます #ai#mathematics#linear-algebra#calculus#probability