タグ: #reproducibility
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationLLM Opsが実際にやっていること — 再現性、汚染、チェックポイント、昇格、そしてロールバック
LLM Opsをツールの一覧ではなく責任の一覧として整理しました。学習の実行を再構築できるようにする実行マニフェストに何を含めるべきか、評価セットのデータ汚染をどう防ぎ監査するか、チェックポイント間隔を障害率から逆算する公式と保管コストの実際の数字、評価をCIに組み込む際に何をゲートにするかを扱います。後半では学習とサービングの間の引き継ぎで実際に壊れる箇所、デプロイ後の回帰検知、ロールバック設計を扱います。ツールはカテゴリ別にのみ紹介
2026-08-02 · 23 分で読めます #mlops#llmops#reproducibility#evaluation#model-registryLLMベンチマークツールを分解する — 同じMMLUがハーネスごとに違うスコアを出す理由
ベンチマークのスコアはモデルの属性ではなく、特定の条件下で行われた測定の結果です。同じLLaMA 65Bが同じMMLUで63.6点と48.8点を同時に取った事件は、ハーネスがプロンプトをどう組み立て、正解をどうパースするかがスコアのかなりの部分を決めることを示しています。この記事は評価ハーネスが内部で実際に行っている六つの段階を分解し、lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI
2026-08-02 · 35 分で読めます #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility2026年の新しい Python ノートブックスタック — Marimo・Quarto と Jupyter 以後のデータワークフロー(Observable・Pluto・Polars・DuckDB まで)
Jupyter の隠れた状態(hidden state)、diff 不可能、再現不能という問題は 2026 年でもデータサイエンスワークフロー最大の摩擦点だ。Marimo はノートブックを .py ファイルとして保存し、セル順序ではなくデータフローグラフで実行する反応型ノートブック。Quarto は RMarkdown の後継として多言語・多フォーマットのデータ出版を可能にする。さらに Observable Framework(JS ネ
2026-05-14 · 28 分で読めます #marimo#quarto#jupyter#python-notebook#reactive-notebook