タグ: #evaluation
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 38 件
AIエンジニア会議の英語: 分からないと言いながら信頼を失わない方法
AIチームの会議でいちばんよく必要になる英語は、確信を表す言葉ではなく、不確実性を信頼感をもって表す言葉です。評価結果とその限界を一緒に伝えること、原因がまだ不明な回帰の報告、指標は上がったのに品質は上がっていないとき、ラベリングの意見の相違、コストと遅延のトレードオフ、研究の日程と製品の日程の衝突、非技術の利害関係者への不確実性の説明、他人の実験への異議、再現できないときまで、場面別の表現を整理しました。ヘッジ表現の強さの目盛りと、ア
2026-08-16 · 50 分で読めます #english#business-english#meeting#ai#llm評価者のボトルネック — 弱い採点者がシステム全体の上限になります
ハーネスをどれだけ直してもスコアが動かないなら、ボトルネックはハーネスではなく評価者かもしれません。測定できない品質は選択できず、だから弱い採点者がシステム全体の上限になります。ハーネスエンジニアリング連載第5回では、スモークテストからユニットテスト、ルーブリック、採点データの隔離、牽制指標のパネルまで、評価者のはしごと、評価の較正を先にすべき理由を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트リワードハッキング — 指標は上がるのに課題は失敗します
エージェントにとってテストを通す最も安い方法がテストを書き換えることなら、エージェントはそうします。リワードハッキングはバグではなく、私たちが定義した目標の正確な最適化の結果です。ハーネスエンジニアリング連載第6回では、採点基準の緩和やassertionの削除といったよくある形、権限の隔離が消してくれる半分、そして牽制指標の設計まで、リワードハッキングへの対応を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트音声認識・合成の技術レポート、何を読むか — WERという一つの数字では見えないもの
音声認識と合成の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。WhisperとOmnilingual ASR、Qwen3-ASR、Open ASR Leaderboard、Seed-TTSとF5-TTS、CosyVoice 2、Qwen3-TTS、Fish Audio S2、Moshi、Qwen2.5-OmniとMOSS-Audioが何を新しく行い、著者がどんな限界を述べたかを読みます。順位ではなく遅延
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech画像生成・理解の技術レポート、何を読むか — サンプル画像ではなく設計を読む
画像生成と理解の技術レポート11本を、arXivの原文アブストラクトで直接確認して整理しました。整流フロートランスフォーマーとVAR、Emu3、SANA、Janus-Pro、FLUX.1 Kontext、Qwen-Image系列、Seedream 4.0、Z-ImageとMage-Flow、InternVL3、そして評価側のQwen-Image-Benchまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。領域別
2026-08-12 · 14 分で読めます #ai-papers#paper-review#technical-report#image-generation#diffusion-transformer動画生成・理解の技術レポート、何を読むか — デモではなく制約を読む
動画生成と理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。CogVideoX、Movie Gen、HunyuanVideo、LTX-Video、Wan、Seedance 1.0と2.0、そして理解側のQwen2.5-VL、VideoLLaMA 3、HY-Himmelまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱わず、長さ・解像度・トークン予算といった実際の制約を見ます。領域別・最
2026-08-12 · 12 分で読めます #ai-papers#paper-review#technical-report#video-generation#diffusion-transformerテキストLLMの技術レポート、何を読むか — 順位ではなく設計判断を読む
テキストLLMの技術レポート9本を、arXivの原文アブストラクトで直接確認して整理しました。DeepSeek-V3とDeepSeek-R1、Qwen3、Gemma 3、Olmo 3、Kimi K2、MiniMax-01、Mellum2、s1がそれぞれ何を新しく行い、著者自身がどんな限界を述べているかを読みます。モデルの順位は扱いません。リーダーボードは動き続け、レポートの数値はほぼ自己申告だからです。領域別・最新技術レポートの読み方シ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#llm#moeOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-aiリーダーボードとベンチマークの読み方 — SOTAの賞味期限はなぜ短いのか
ベンチマーク方法論の論文12本を、arXivの原文アブストラクトで直接確認し、リーダーボードの数値をどう読むべきかを整理しました。データ汚染、プロンプト形式への敏感さ、評価ハーネスの差、自己申告、リーダーボードの標本の偏り、LLM審査者の偏り、そして誤差棒をつける統計的アプローチまで扱います。領域別・最新技術レポートの読み方シリーズの最終回であり、先行する5回を読むための案内でもあります。
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#benchmark#evaluation技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationハーネスは設定ではなくデプロイ成果物です — 自己改善ループの本当のボトルネック
Lilian Wengが2026年7月にまとめたハーネスエンジニアリングの記事は、モデルを包むシステム全体にひとつの工学対象としての名前を与えます。この記事はその定義を移すのではなく、ハーネスを設定ファイルではなくバージョンの付いたデプロイ成果物として扱うと何が変わるのかを扱います。ハーネスの指紋を取って回帰を捕まえる方法、コンテキストを伸び続けるプロンプトではなくプレイブックとして扱う方法、そして自己改善ループの本当のボトルネックがな
2026-08-09 · 13 分で読めます #llm#agent#harness-engineering#context-engineering#evaluation評価駆動開発で最初に較正すべきなのは審査者です
Airbnbエンジニアリングが2026年7月に公開した評価駆動開発の振り返りは、評価セットを先に書けという話ではなく、採点する側のモデルがまず計測器として認められなければならないという話に近いものです。この記事は、審査者モデルをゴールデンセット50〜100件で較正する手順、一致度を単純な正確度ではなくカッパで測るべき理由、そして較正されていない審査者がどうやってチーム全体を誤った方向へ最適化させてしまうのかを、実行可能なコードとともに整
2026-08-09 · 16 分で読めます #ai#llm#eval-driven-development#llm-as-judge#evaluationLLM Opsが実際にやっていること — 再現性、汚染、チェックポイント、昇格、そしてロールバック
LLM Opsをツールの一覧ではなく責任の一覧として整理しました。学習の実行を再構築できるようにする実行マニフェストに何を含めるべきか、評価セットのデータ汚染をどう防ぎ監査するか、チェックポイント間隔を障害率から逆算する公式と保管コストの実際の数字、評価をCIに組み込む際に何をゲートにするかを扱います。後半では学習とサービングの間の引き継ぎで実際に壊れる箇所、デプロイ後の回帰検知、ロールバック設計を扱います。ツールはカテゴリ別にのみ紹介
2026-08-02 · 23 分で読めます #mlops#llmops#reproducibility#evaluation#model-registryGemini Robotics 2とロボット基盤モデル — 全身制御が実際に変えるもの
2026年7月30日、Google DeepMindがGemini Robotics 2を公開し、ヒューマノイドのつま先から指先までを一つのビジョン・ランゲージ・アクションモデルで制御すると発表しました。一緒に公開された数字は興味深いことに自慢ではなく現状の正直な記録に近いものです — 電球を緩めるのに92パーセント、締めるのに36パーセント、床から物を拾うのに45.7パーセント。この記事はVLAが実際に何なのか、全身制御がなぜ上半身操
2026-07-31 · 25 分で読めます #ai#robotics#vla#foundation-models#evaluationRAGが的外れな答えを返すとき — 検索の失敗と生成の失敗を切り分けるデバッグ手順
RAGが誤った答えを出すと、たいていはプロンプトから直しにかかりますが、実際の原因の多くは検索段階にあります。正解チャンクを手で入れてみるという一度の実験で検索の失敗と生成の失敗を切り分ける手順から始め、チャンキングがなぜ最もよくある犯人なのか、埋め込み類似度が意味的類似度と分かれる地点とBM25の混合がしばしば勝つ理由、リランキングが値打ちを出す条件、チャンクに文書タイトルとメタデータを付けたときの効果を整理しました。最後にゴールデン
2026-07-26 · 23 分で読めます #llm#rag#retrieval#chunking#evaluationLLM評価を勘でやらない方法 — 標本サイズ、審査者バイアス、CI回帰テスト
プロンプトを直して「良くなった気がする」でデプロイするチームには、静かに積み上がる回帰を見る方法がありません。評価をアサーション、ゴールデンデータセット、LLM-as-judge、人手評価の四層に分けてそれぞれのコストと信頼度を整理し、審査者モデルの位置バイアスと長さ選好をどう相殺するかを扱います。例20個で出した結論の信頼区間が実際どれだけ広いのかを計算し、ペア比較が必要標本を何分の一に減らすのかをコードで示します。温度0でも完全には
2026-07-26 · 20 分で読めます #llm#evaluation#llm-as-judge#statistics#regression-testingAIコードレビューは実際に使い物になるのか — 測定された証拠が語る精度と偽陽性
AIコードレビューツールのマーケティング文句には「PRの80%に人間のコメントが不要」といった数字があふれていますが、精度と偽陽性率をあわせて公開しているところはほとんどありません。公開されている測定値を集めてみると、方向はおおむね一致します — オープンソースのPRでAIレビューコメントが実際のコード変更につながった割合はツールによって0.9〜19.2%で、人間のコメントの60%に大きく及びませんでした(Ganら、GitHub Act
2026-07-17 · 47 分で読めます #ai#code-review#static-analysis#evaluation#software-engineeringシミュレーションされた顧客は絶対に離脱しない — LLMユーザーシミュレーターがエージェントのスコアを水増しする場所
τ-bench系の対話型エージェントベンチマークでは、「ユーザー」役はもう一つのLLMが務めます。ところがこのシミュレーターは測定対象ではなく測定器具であり、器具は校正を受けなければなりません。2026年に出た3本の検証研究は同じ方向を指しています — シミュレーションされたユーザーは協調的すぎるのです。実在の人間451人でτ-benchプロトコルをそのまま回した研究は、シミュレーターが作る「イージーモード」がエージェントの成功率を人間
2026-07-16 · 41 分で読めます #ai#llm#evaluation#agents#simulationtts-bench: 品質が主観的なとき、ローカル TTS をどう比べるか
tts-bench は開発者 5uck1ess によるローカルベンチマークで、手元のハードウェアで55の TTS モデルを比較します。評価を三つのレンズに分けます。速度(TTFA・RTF・メモリ)、試聴(すべてのモデルを耳で判断)、スコア(UTMOS・WER・SIM)です。最も興味深いのは主観性に対する正直さです。「最も良く聞こえる」という単一のスコアはありません。品質はあなたの耳と用途に依存するからです。本稿では、このツールが実際に何
2026-07-11 · 9 分で読めます #tts#text-to-speech#benchmark#local-ai#evaluation2026 年の良いエージェントベンチマークとは — UniClawBench、ライブコンテナ、隠れた監督者
HKU MMLab が 2026 年 7 月に arXiv へ投稿した UniClawBench は、「能力駆動(capability-driven)」を掲げるプロアクティブエージェント向けのベンチマークです。あらかじめ記録された静的な正解と照合する代わりに、ライブの Docker コンテナ内でエージェントを動かし、きめ細かなステップ単位のチェックポイントで採点します。実行者・隠れた監督者・ユーザーエージェントからなる閉ループで多ターン
2026-07-11 · 9 分で読めます #ai#agents#evaluation#benchmark#llm