タグ: #kv-cache
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 17 件
vLLM 内部構造 (5) — プレフィックスキャッシュ、システムプロンプト設計が性能になる理由
vLLMのプレフィックスキャッシュがいつ効いていつ効かないかを、公式設計ドキュメントを基準に整理する。ブロックハッシュが直前のブロックに鎖のように連なる構造、フルに埋まったブロックだけがキャッシュされる理由、プロンプトの先頭に置いたタイムスタンプ一つがキャッシュ全体を無効にする過程、そしてcachesaltまで扱う。vLLM内部構造シリーズ第5回。
2026-08-12 · 12 分で読めます #vllm#prefix-caching#kv-cache#prompt-engineering#llmvLLM 内部構造 (4) — スケジューラとプリエンプション、スループットが崩れる地点
vLLMスケジューラが毎ステップ何を決定しているのか、待機キューと実行リストがどう動くのか、KVキャッシュが不足したときに起きるプリエンプション(preemption)がレイテンシと処理量をどう崩すのかを、公式ドキュメントとV1スケジューラソースで確認して整理した。recomputeとswapの違い、fcfsとpriorityポリシーも合わせて扱う。vLLM内部構造シリーズ第4回。
2026-08-12 · 12 分で読めます #vllm#scheduler#preemption#kv-cache#llmvLLM 内部構造 (2) — PagedAttention はなぜ KV キャッシュをページに分けたのか
PagedAttentionがKVキャッシュをブロック単位に分割した理由を、原論文(arXiv:2309.06180)とvLLM公式設計ドキュメントで確認して整理した。連続割り当てが生む内部・外部フラグメンテーション、ブロックテーブルが担う役割、ブロックサイズを大きくしたり小さくしたりする際のトレードオフまで扱う。vLLM内部構造シリーズ第2回。
2026-08-12 · 12 分で読めます #vllm#paged-attention#kv-cache#llm#gpuアテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mlaLLM推論のVRAM計算 — 重みより先にKVキャッシュが溢れます
「このモデルはうちのGPUに載りますか」という質問に、掛け算を数回するだけで答える方法をまとめました。重みのメモリはパラメータ数×バイト数で終わりますが、実際にデプロイを止めるのはシーケンス長とバッチに比例して育つKVキャッシュです。KVキャッシュの公式とGQAがそれを何分の一かに減らす原理、プリフィル活性化とフレームワークオーバーヘッドの大きさ、PagedAttentionが消した断片化の損失、そして4bit量子化がタダではない理由を
2026-07-26 · 20 分で読めます #llm#inference#vram#kv-cache#quantizationローカルでLLMを動かすにはVRAMがどれだけ必要か — 表ではなく数式で計算する
「8Bモデルには何GB必要ですか」の正解は表ではなく2つの数式です。重みはパラメータ数 × bpw ÷ 8、KVキャッシュは2 × レイヤー数 × KVヘッド数 × headdim × バイト数 × トークン数です。本稿はこの2つの式をllama.cppのソースと公式の表に直接照らして検証します — ggmlのブロック構造体から導いたQ80の8.5 bpwはllama.cppが公表した8.5008と小数第3位まで一致し、同じやり方で逆算
2026-07-17 · 43 分で読めます #llm#quantization#kv-cache#local-llm#gpuPD分離はスループットを増やさない — プリフィル/デコード分離が実際に買うもの
プリフィルとデコードを別々のGPUに分けるPD分離は、2026年にvLLM・SGLang・TensorRT-LLMすべてに入った設計ですが、どこを見ても「2倍から7倍」という数字ばかりが出回っています。ところがvLLM公式ドキュメントは同じ機能について「分離プリフィルはスループットを改善しない」と大文字で明記しています。実は両方とも正しいのです — そのベンダー数値はすべて、スループットではなくgoodput(SLOを守った処理量)か、
2026-07-16 · 29 分で読めます #llm#ai#inference#kv-cache#vllmKVキャッシュを4ビットへ — SAW-INT4とシステムを踏まえたINT4量子化
長文脈のLLMサービングで本当のメモリのボトルネックは、重みではなくKVキャッシュです。これを素朴にINT4へ落とすと精度が崩れますが、2026年4月のプリプリントSAW-INT4は、トークン単位のINT4量子化にブロック対角アダマール回転を組み合わせ、素朴なINT4が失った精度をほぼ取り戻すと報告します。この論文の本当の狙いは精度だけでなくスループットです — ページド型KVキャッシュのレイアウトに直接組み込む融合回転・量子化カーネル
2026-07-11 · 12 分で読めます #ai#llm#quantization#inference#kv-cacheマルチモーダルLLMのサービング — 画像入力が生む新たな課題
テキスト専用LLMサービングとの違いから、ビジョンエンコーダの追加段階、可変のビジュアルトークン数、プリフィルコストの急増、マルチモーダルKVキャッシュとバッチングの難しさ、遅延分解とスループット最適化、コストと運用の落とし穴まで、マルチモーダルLLMサービングの実務を整理します。
2026-06-26 · 24 分で読めます #mlops#multimodal#llm-serving#vllm#kv-cacheKVキャッシュとPagedAttention — 推論メモリのすべて
LLM推論でメモリを最も消費する張本人であるKVキャッシュを深く掘り下げます。KVキャッシュとは何か、なぜメモリを消費するのか、メモリの計算と断片化の問題、PagedAttentionのブロック管理、prefix共有とKV量子化まで、開発者の視点で整理します。
2026-06-26 · 21 分で読めます #kv-cache#paged-attention#inference#gpu-memory#quantizationTransformer構造の完全解剖 — AttentionからKV Cacheまで
Transformerのself-attention、マルチヘッド、位置エンコーディング、FFN、残差接続と正規化をゼロから分解して説明します。テンソルのshapeとパラメータ数の計算、causal mask、エンコーダ/デコーダ構造、そして推論時のKV cacheまでを一つの流れでつなげます。
2026-06-26 · 25 分で読めます #llm#transformer#attention#positional-encoding#kv-cacheアテンションの進化 — MQA、GQA、FlashAttention、そして長いコンテキスト
標準アテンションのメモリと演算コストを分析し、MQAとGQAがKV cacheをどう削減するか、FlashAttentionがIOをどう最適化するかを説明します。スライディングウィンドウや長コンテキスト手法を比較し、これらの選択がサービングメモリに与える影響までたどります。
2026-06-26 · 28 分で読めます #llm#attention#flashattention#gqa#mqaLLM推論最適化完全ガイド2025:vLLM、TensorRT-LLM、KV Cache、Speculative Decoding
LLM推論最適化のすべて!vLLM(PagedAttention)、TensorRT-LLM(FP8/INT4)、KV Cache管理、Speculative Decoding、Continuous Batching、FlashAttention、量子化(GPTQ/AWQ/GGUF)、モデルサービング(Triton/vLLM/TGI)、GPUメモリ最適化、コスト分析。
2026-04-14 · 31 分で読めます #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingLLM推論最適化完全ガイド: KVキャッシュ・投機的デコーディング・連続バッチング
LLM推論を限界まで最適化するための完全ガイド。KVキャッシュ、投機的デコーディング、連続バッチング、PagedAttention、FlashInfer、マルチGPU推論、DeepSeek MLAを徹底解説。
2026-03-17 · 25 分で読めます #llm#inference#optimization#kv-cache#speculative-decodingLLM推論最適化完全ガイド: vLLM、TensorRT-LLM、Speculative Decoding
LLM推論性能を最大化するための主要技術であるvLLM、TensorRT-LLM、Speculative Decoding、KV Cache最適化を、実践的なコードとベンチマークで比較分析します。
2026-03-14 · 29 分で読めます #llm#inference-optimization#vllm#tensorrt-llm#speculative-decodingKV Cache 最適化 深層分析: GQA・MLA・MHA アテンションメカニズムとメモリ効率化戦略
Transformer Self-AttentionのKV Cache基本原理からMHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)メカニズムのメモリ分析と比較、KV Cache圧縮技法(量子化、エビクションポリシー、スライディングウィンドウ)、PagedAttention(vLLM)実装、PyTorchコード例、OOM障害事例と最適化チェックリストを解説します。
2026-03-11 · 22 分で読めます #ai-papers#kv-cache#attention-mechanism#gqa#mlaLLMロングコンテキスト性能とKV Cache最適化完全ガイド:MQAからRing Attentionまで
LLMのロングコンテキスト処理を支えるKV Cacheの原理からメモリ消費量分析、MQA・GQA・PagedAttention・スライディングウィンドウ・Ring Attentionなどの最適化手法、モデル別コンテキストウィンドウ比較、Needle-in-a-Haystackベンチマークまで、実務観点から包括的に解説します。
2026-03-07 · 25 分で読めます #llm#kv-cache#long-context#multi-query-attention#grouped-query-attention