タグ: #tensor-parallel
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
vLLM 内部構造 (7) — デプロイのチューニングとよくある落とし穴、OOM の切り分け順
vLLMのデプロイを実際にチューニングする手順を整理する。gpumemoryutilizationが何を決めるのか、テンソル並列とパイプライン並列をいつ使うのか、量子化とKVキャッシュのデータ型をどう選ぶのか、そしてOOMが起きたときに起動段階と運用段階を分けて診断する手順まで、公式ドキュメントを基準に確認して整理した。vLLM内部構造シリーズ最終回。
2026-08-12 · 16 分で読めます #vllm#gpu#quantization#tensor-parallel#llm