タグ: #llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 208 件
Hugging Faceのモデルカードの読み方: 何を信じ、何を疑うか
Hugging Faceのモデルカードで実際に判断材料になる項目は、ライセンス、パラメータ数、コンテキスト長、intended use、limitations、学習データの6つです。この記事は各項目が何を意味し何を隠すのか、ダウンロード数といいね数がなぜ品質指標にならないのか、そしてカードに書かれていない項目をどう扱うべきかを、2026-08-12に実際に確認したモデルページの事例で整理します。オープンモデルガイドシリーズ第1回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#model-card埋め込みとリランカー、RAGで実際に重要なもの
RAGを作るとき埋め込みモデルの選択を左右するのは、リーダーボードの順位ではなく次元、最大入力長、接頭辞の規約、多言語対応の表記、そしてリランカーとの役割分担です。この記事は2026-08-12に確認した埋め込み・リランカーモデルの実際のカード値を整理し、MTEBのスコアが何を語らないのか、日本語や韓国語の文書を扱うときに何を自分で測るべきかを説明します。オープンモデルガイドシリーズ第3回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#embeddingvLLM 内部構造 (5) — プレフィックスキャッシュ、システムプロンプト設計が性能になる理由
vLLMのプレフィックスキャッシュがいつ効いていつ効かないかを、公式設計ドキュメントを基準に整理する。ブロックハッシュが直前のブロックに鎖のように連なる構造、フルに埋まったブロックだけがキャッシュされる理由、プロンプトの先頭に置いたタイムスタンプ一つがキャッシュ全体を無効にする過程、そしてcachesaltまで扱う。vLLM内部構造シリーズ第5回。
2026-08-12 · 12 分で読めます #vllm#prefix-caching#kv-cache#prompt-engineering#llmvLLM 内部構造 (3) — 連続バッチングが GPU を遊ばせない仕組み
静的バッチングがなぜGPUを遊ばせるのか、vLLMのイテレーション単位のスケジューリングがそれをどうなくすのかを整理した。prefillとdecodeの性質の違い、V1の統合スケジューラとトークン予算、chunked prefillがレイテンシと処理量に与える影響を公式ドキュメント基準で確認した。vLLM内部構造シリーズ第3回。
2026-08-12 · 11 分で読めます #vllm#continuous-batching#chunked-prefill#llm#inferencevLLM 内部構造 (4) — スケジューラとプリエンプション、スループットが崩れる地点
vLLMスケジューラが毎ステップ何を決定しているのか、待機キューと実行リストがどう動くのか、KVキャッシュが不足したときに起きるプリエンプション(preemption)がレイテンシと処理量をどう崩すのかを、公式ドキュメントとV1スケジューラソースで確認して整理した。recomputeとswapの違い、fcfsとpriorityポリシーも合わせて扱う。vLLM内部構造シリーズ第4回。
2026-08-12 · 12 分で読めます #vllm#scheduler#preemption#kv-cache#llmvLLM 内部構造 (1) — リクエスト一つがトークンになるまでの全経路
vLLMにリクエストが一つ入ってからトークンが出てくるまでの全経路をたどる。APIサーバー、スケジューラ、KVキャッシュマネージャ、ワーカー、サンプラーがそれぞれ何をしているのか、V1書き換え以降プロセスがどう分かれているのかを公式ドキュメントとソースで確認して整理した。vLLM内部構造シリーズ第1回。
2026-08-12 · 9 分で読めます #vllm#llm#inference#gpu#ai-platformvLLM 内部構造 (7) — デプロイのチューニングとよくある落とし穴、OOM の切り分け順
vLLMのデプロイを実際にチューニングする手順を整理する。gpumemoryutilizationが何を決めるのか、テンソル並列とパイプライン並列をいつ使うのか、量子化とKVキャッシュのデータ型をどう選ぶのか、そしてOOMが起きたときに起動段階と運用段階を分けて診断する手順まで、公式ドキュメントを基準に確認して整理した。vLLM内部構造シリーズ最終回。
2026-08-12 · 16 分で読めます #vllm#gpu#quantization#tensor-parallel#llmvLLM 内部構造 (2) — PagedAttention はなぜ KV キャッシュをページに分けたのか
PagedAttentionがKVキャッシュをブロック単位に分割した理由を、原論文(arXiv:2309.06180)とvLLM公式設計ドキュメントで確認して整理した。連続割り当てが生む内部・外部フラグメンテーション、ブロックテーブルが担う役割、ブロックサイズを大きくしたり小さくしたりする際のトレードオフまで扱う。vLLM内部構造シリーズ第2回。
2026-08-12 · 12 分で読めます #vllm#paged-attention#kv-cache#llm#gpuvLLM 内部構造 (6) — コンテキストウィンドウ、max_model_len、max_tokens 完全整理
コンテキストウィンドウとmaxtokensの違いが紛らわしいなら、この記事一つで整理できる。モデルのコンテキストウィンドウ(構造的な上限)、vLLMのmaxmodellen(エンジン設定)、リクエストごとの生成上限であるmaxtokensとmaxcompletiontokens、そしてバッチの上限であるmaxnumbatchedtokensとmaxnumseqsがそれぞれ何を制限するのかを、比較表と実際のエラーメッセージで整理した。入力
2026-08-12 · 20 分で読めます #vllm#context-window#max-model-len#max-tokens#llmテキストLLMの技術レポート、何を読むか — 順位ではなく設計判断を読む
テキストLLMの技術レポート9本を、arXivの原文アブストラクトで直接確認して整理しました。DeepSeek-V3とDeepSeek-R1、Qwen3、Gemma 3、Olmo 3、Kimi K2、MiniMax-01、Mellum2、s1がそれぞれ何を新しく行い、著者自身がどんな限界を述べているかを読みます。モデルの順位は扱いません。リーダーボードは動き続け、レポートの数値はほぼ自己申告だからです。領域別・最新技術レポートの読み方シ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#llm#moe攻撃者のいない侵害事故 — エージェントの資格情報を見直すべき理由
Hugging Faceは2026年7月16日に自律エージェントによる本番環境の侵害を公開し、約3週間後にOpenAIはその攻撃が自社の学習環境から流れ出たものだったと明かしました。この記事は事件の要約ではなく、その事件が脅威モデルに何を追加するのかを扱います。悪意がなくても権限を持った自動化は目標へ向けて漂流すること、このとき実際に働いた防衛線が侵入検知ではなく資格情報の寿命と範囲だったこと、そしてその事実が自分の組織の点検項目をどう
2026-08-09 · 15 分で読めます #security#llm#agent#incident-response#credentialsコーディングエージェントのコストは上限ではなく摩擦で抑える
Databricksが2026年7月と8月に相次いで公開した二本のエンジニアリング記事は、コーディングエージェントの支出を扱う方法が予算上限からゲートウェイと段階的な摩擦へ移りつつあることを示しています。この記事はその設計を分解します。なぜハード予算が最後の手段なのか、なぜ日次の暴走防止と月次のガバナンスを分けるのか、なぜ増分ひとつの大きさが設計のすべてなのか、そして実際にコストを支配するのがモデル単価ではなくコンテキストなのはなぜかを
2026-08-09 · 15 分で読めます #mlops#llm#cost#ai-gateway#developer-productivity推論強度はモデル選択ではなくリクエスト単位のデプロイパラメータです
ARC Prizeが公開したDeepSeek V4 Flash 0731の結果ページには、スコアがひとつではなく推論強度別に三つ載っています。この記事はその三つの数字から実際に読み取れることを計算します。同じ強度の引き上げが、易しいベンチマークでは5ポイントを、難しいベンチマークでは15ポイントを買ってくれるという事実と、ならば強度はモデル設定ではなくリクエストごとに決める値として扱うべきだという結論です。はしごを上る構造と、その構造が
2026-08-09 · 15 分で読めます #llm#benchmark#arc-agi#inference#cost100倍安いという主張は課題を狭めたときにだけ真です — 検証と損益分岐
2026年8月に公開されたある事例記事は、40億パラメータ級のオープンモデルを強化学習で後学習し、検索課題でフロンティアモデルと肩を並べながらリクエストあたりのコストを桁単位で下げたと述べます。この記事はその主張を紹介するのではなく検証します。原文で実際に確認できる数字と確認できない数字を区別し、狭い課題でだけ成立する条件が何かを整理し、後学習がルーティングより有利になる損益分岐を自分で計算できるコードを付けました。
2026-08-09 · 14 分で読めます #llm#cost#fine-tuning#retrieval#open-modelsハーネスは設定ではなくデプロイ成果物です — 自己改善ループの本当のボトルネック
Lilian Wengが2026年7月にまとめたハーネスエンジニアリングの記事は、モデルを包むシステム全体にひとつの工学対象としての名前を与えます。この記事はその定義を移すのではなく、ハーネスを設定ファイルではなくバージョンの付いたデプロイ成果物として扱うと何が変わるのかを扱います。ハーネスの指紋を取って回帰を捕まえる方法、コンテキストを伸び続けるプロンプトではなくプレイブックとして扱う方法、そして自己改善ループの本当のボトルネックがな
2026-08-09 · 13 分で読めます #llm#agent#harness-engineering#context-engineering#evaluationLLMができないのは証明ではなく前提を立てることです
ICML 2026の立場論文 Position: LLMs can not jump は、生成AIが帰納をすでにマスターし演繹も急速に征服しつつある一方で、新しい説明仮説を作り出すアブダクションには構造的に到達できないと主張します。この記事はその主張を要約する代わりに、それが事実だと仮定したときに、いま私たちが作っているシステムの設計をどう変えるべきかを扱います。仮説空間をどこから供給するのか、提案と反証をなぜ分離すべきなのか、そしてこ
2026-08-09 · 15 分で読めます #ai#llm#reasoning#abduction#research評価駆動開発で最初に較正すべきなのは審査者です
Airbnbエンジニアリングが2026年7月に公開した評価駆動開発の振り返りは、評価セットを先に書けという話ではなく、採点する側のモデルがまず計測器として認められなければならないという話に近いものです。この記事は、審査者モデルをゴールデンセット50〜100件で較正する手順、一致度を単純な正確度ではなくカッパで測るべき理由、そして較正されていない審査者がどうやってチーム全体を誤った方向へ最適化させてしまうのかを、実行可能なコードとともに整
2026-08-09 · 16 分で読めます #ai#llm#eval-driven-development#llm-as-judge#evaluationモデルカードを正しく読む方法 — 5分で必要なものだけ抜き出す
モデルカードは上から下へ読むと必要な情報にたどり着けないように書かれています。ベンチマーク表が画面の半分を占める一方で、ライセンスとチャットテンプレートは一行で通り過ぎます。この記事はカードを読む順序を逆転させ、配備判断に実際に必要な七つを5分で抜き出す方法を整理しました。重みの公開とオープンソースがどう違うか、カードの点数をそのまま信じてはいけない理由、コンテキスト長の表記が何を隠しているか、そしてトークナイザとチャットテンプレートで
2026-08-02 · 33 分で読めます #llm#huggingface#model-card#license#tokenizerこれらのモデルはどう作られたのか — 2026年オープンウェイトパイプライン解剖
2026年8月時点でHugging Faceの上位に並ぶオープンウェイトモデルのカードと技術レポートを読み、データ収集から量子化デプロイまでの制作パイプラインを順番に整理しました。MoEのスパース性が20倍を超えた理由、グローバルアテンションを減らす四つのアプローチ、事前学習のトークン予算と安定化技法、SFT後の選好最適化と強化学習、そして蒸留と低ビットデプロイまでを実際のモデルを例に扱います。重要な前提を先に明かすと、ほとんどのオープ
2026-08-02 · 31 分で読めます #llm#pretraining#moe#post-training#quantization今Hugging Faceで何が伸びているか — 2026年8月トレンディングマップ
2026年8月2日時点でHugging Faceのトレンディング一覧を実際に洗い、用途別に実務で使えるモデルを整理しました。汎用LLM、コーディング、埋め込みとリランカー、ビジョン、音声、画像・動画生成、小型オンデバイスの順で、作り手と規模とライセンス、そして使う前に知っておくべき制約を一緒に書きました。核心は、トレンディング一覧の相当数が新規モデルではなく量子化再アップロードとコミュニティのファインチューンだという点です。原本と派生版
2026-08-02 · 28 分で読めます #llm#huggingface#open-weights#model-selection#quantization