タグ: #benchmark
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 16 件
Gemini 3.7 Flashの導入価格と3週間サイクル — モデル原価を固定費ではなく条件付きの値として扱う理由
Gemini 3.7 Flashの発表で実務者が見るべきはベンチマークの上げ幅ではなく、2つの事実です。1つは特定の日付で単価が2倍になる導入価格の構造、もう1つは直前のモデルが3週間前に出たという点です。2つが重なると、モデル原価は固定費ではなく期限付きの条件付きの値になります。公開されたベンチマークが何と比較し何と比較していないのか、そして発表で最後まで公開されなかった2つの数字がなぜアーキテクチャを決める数字なのかを整理します。
2026-08-14 · 12 分で読めます #llm#cost-optimization#benchmark#api-design#capacity-planningリーダーボードとベンチマークの読み方 — SOTAの賞味期限はなぜ短いのか
ベンチマーク方法論の論文12本を、arXivの原文アブストラクトで直接確認し、リーダーボードの数値をどう読むべきかを整理しました。データ汚染、プロンプト形式への敏感さ、評価ハーネスの差、自己申告、リーダーボードの標本の偏り、LLM審査者の偏り、そして誤差棒をつける統計的アプローチまで扱います。領域別・最新技術レポートの読み方シリーズの最終回であり、先行する5回を読むための案内でもあります。
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#benchmark#evaluation命令ひとつが62秒かかりうる — 遅延は命令ではなく経路の属性だ
Assembly Hall of Shameは、単一命令をもっとも遅くする競争の順位表です。最下位のnopが1サイクル、1位のfxrstor64が1,980億サイクルで62秒です。この順位表を下から上へ読むと、現代のCPUが止まりうるあらゆる地点の一覧になり、マイクロコード補助の経路、キャッシュラインをまたぐアトミック演算、TLBの無効化、エントロピーの枯渇、そしてダイの外のPCIeファブリックまで三つの区間に分かれます。この表が実際に
2026-08-09 · 18 分で読めます #os-concepts#performance#cpu#microarchitecture#benchmark推論強度はモデル選択ではなくリクエスト単位のデプロイパラメータです
ARC Prizeが公開したDeepSeek V4 Flash 0731の結果ページには、スコアがひとつではなく推論強度別に三つ載っています。この記事はその三つの数字から実際に読み取れることを計算します。同じ強度の引き上げが、易しいベンチマークでは5ポイントを、難しいベンチマークでは15ポイントを買ってくれるという事実と、ならば強度はモデル設定ではなくリクエストごとに決める値として扱うべきだという結論です。はしごを上る構造と、その構造が
2026-08-09 · 15 分で読めます #llm#benchmark#arc-agi#inference#costvLLMを速くする — 設定、内部構造、そしてコードに手を入れるべき場所
vLLMの性能を上げる作業を、コードを触らずにできることから順に整理します。バッチ関連の引数とプレフィックスキャッシュ、チャンクドプリフィル、量子化の選択をまず扱い、そのあとPagedAttentionと連続バッチングスケジューラが内部で何を決めているのかを、実際のソースを根拠に説明します。実際にコードを触る価値のある三箇所、カスタムロジットプロセッサ、カスタムアテンションバックエンド、スケジューラポリシーとその代償も押さえます。何を固
2026-08-02 · 33 分で読めます #vllm#llm-inference#paged-attention#benchmark#schedulerLLMベンチマークツールを分解する — 同じMMLUがハーネスごとに違うスコアを出す理由
ベンチマークのスコアはモデルの属性ではなく、特定の条件下で行われた測定の結果です。同じLLaMA 65Bが同じMMLUで63.6点と48.8点を同時に取った事件は、ハーネスがプロンプトをどう組み立て、正解をどうパースするかがスコアのかなりの部分を決めることを示しています。この記事は評価ハーネスが内部で実際に行っている六つの段階を分解し、lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI
2026-08-02 · 35 分で読めます #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibilityブラウザ・コンピュータを操作するAIエージェントはいまどこまで来たか — ベンチマークの数字が実際に測っているもの
「コンピュータユースエージェントがOSWorldで83.5%を記録した」と「最強のエージェントでも20.6%しか完了できない」は、どちらも2026年に出た事実であり、どちらも正しいのです。前者はOSWorld 1.0、後者は同じチームが作ったOSWorld 2.0です。本稿ではその隔たりがどこから来るのかを、原論文とベンチマーク著者らの自己測定でたどります。OSWorldの課題の半分近くはGUIをほとんど使わずターミナルで解けるというE
2026-07-17 · 44 分で読めます #ai#computer-use#browser-agents#benchmark#prompt-injectionAIエージェントのメモリは実際にどう作られているのか — 4つの設計と、ベンチマークが実際に証明したこと
「エージェントメモリ」は単一の技術ではなく、少なくとも4つの異なる設計をひとまとめにした言葉です — ファイルスクラッチパッド、要約/コンパクション、ベクトル回収、知識グラフ。本稿はまず、それぞれが実際に何をするのかを製品ドキュメントで確認し、その後もっと不都合な質問を投げかけます: どちらが優れているという根拠は、実際に測定されたことがあるのか? Mem0論文(arXiv:2504.19413)の表を直接読むと、ヘッドラインの「Ope
2026-07-17 · 38 分で読めます #ai#ai-agent#agent-memory#llm#benchmarktts-bench: 品質が主観的なとき、ローカル TTS をどう比べるか
tts-bench は開発者 5uck1ess によるローカルベンチマークで、手元のハードウェアで55の TTS モデルを比較します。評価を三つのレンズに分けます。速度(TTFA・RTF・メモリ)、試聴(すべてのモデルを耳で判断)、スコア(UTMOS・WER・SIM)です。最も興味深いのは主観性に対する正直さです。「最も良く聞こえる」という単一のスコアはありません。品質はあなたの耳と用途に依存するからです。本稿では、このツールが実際に何
2026-07-11 · 9 分で読めます #tts#text-to-speech#benchmark#local-ai#evaluation2026 年の良いエージェントベンチマークとは — UniClawBench、ライブコンテナ、隠れた監督者
HKU MMLab が 2026 年 7 月に arXiv へ投稿した UniClawBench は、「能力駆動(capability-driven)」を掲げるプロアクティブエージェント向けのベンチマークです。あらかじめ記録された静的な正解と照合する代わりに、ライブの Docker コンテナ内でエージェントを動かし、きめ細かなステップ単位のチェックポイントで採点します。実行者・隠れた監督者・ユーザーエージェントからなる閉ループで多ターン
2026-07-11 · 9 分で読めます #ai#agents#evaluation#benchmark#llmBFCLベンチマーク完全ガイド2025:Tool Calling性能評価、リーダーボード分析、モデル比較
BFCL(Berkeley Function Calling Leaderboard)の全て!ベンチマークカテゴリ(Simple/Multiple/Parallel/Relevance/AST)、評価メトリック、モデル性能比較(Claude/GPT/Gemini/Llama)、自社モデル評価方法、Tool Calling改善戦略。
2026-03-25 · 30 分で読めます #bfcl#benchmark#tool-calling#function-calling#evaluation2025年オープンソースAIモデル完全比較:DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral
DeepSeek R1(671B/37B)、Llama 4 Scout/Maverick、Qwen 3(235B MoE)、Mistral 8x22B — 2025年オープンソースAIモデル4強完全比較。ベンチマーク、ライセンス、デプロイ方法、コスト分析まで。
2026-03-22 · 59 分で読めます #open-source#ai#llm#deepseek#llama2025年3月テック・AI・K-POPウィークリーダイジェスト:GTCからBTSカムバックまで
NVIDIA GTC 2025 Blackwell Ultra発表、Gemini 2.5 Proのベンチマーク制覇、MCPの業界標準化、DeepSeek-R1オープンソースの衝撃、BTS 5年ぶりの完全体カムバック、JENNIEソロアルバムのミリオンセラー達成など、2025年3月のテック・AI・K-POPの核心トレンドを一挙に整理します。
2026-03-21 · 19 分で読めます #culture#ai#kpop#nvidia#gtcLLM評価とベンチマーク完全ガイド:MMLU、MT-Bench、RAGAS、LM-Eval
LLMを正しく評価するための完全ガイド。MMLU、MT-Bench、HumanEvalなどの標準ベンチマークから、RAGASによるRAGシステム評価、LM-Evaluation-Harnessの実践的使用、そしてプロダクションLLM評価パイプラインまで詳しく解説します。
2026-03-17 · 24 分で読めます #llm#evaluation#benchmark#ragas#lm-evalLLM評価・ベンチマーク完全ガイド:本当に重要なことを測定する
LLMの評価とベンチマークに関する包括的なガイドです。標準的な学術ベンチマーク(MMLU、HELM、MT-Bench)、本番環境での評価パイプライン、LLM-as-judge、人間による評価、RAG評価、安全性テスト、実用的なカスタム評価フレームワークの構築方法までを網羅しています。
2026-03-17 · 27 分で読めます #llm#evaluation#benchmark#mmlu#helmAIベンチマークデータセット完全ガイド: ImageNet、COCO、GLUE、MMLU、HumanEval
AIモデル評価のための主要ベンチマークデータセット完全ガイド。コンピュータビジョン(ImageNet、COCO、ADE20K)、NLP(GLUE、SuperGLUE、SQuAD、MMLU)、コード(HumanEval、MBPP)、LLM評価(HELM、MT-Bench)を詳細解説。
2026-03-17 · 32 分で読めます #benchmark#datasets#imagenet#coco#glue