タグ: #chunked-prefill
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
vLLM 内部構造 (3) — 連続バッチングが GPU を遊ばせない仕組み
静的バッチングがなぜGPUを遊ばせるのか、vLLMのイテレーション単位のスケジューリングがそれをどうなくすのかを整理した。prefillとdecodeの性質の違い、V1の統合スケジューラとトークン予算、chunked prefillがレイテンシと処理量に与える影響を公式ドキュメント基準で確認した。vLLM内部構造シリーズ第3回。
2026-08-12 · 11 分で読めます #vllm#continuous-batching#chunked-prefill#llm#inference