タグ: #vram
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
LLM推論のVRAM計算 — 重みより先にKVキャッシュが溢れます
「このモデルはうちのGPUに載りますか」という質問に、掛け算を数回するだけで答える方法をまとめました。重みのメモリはパラメータ数×バイト数で終わりますが、実際にデプロイを止めるのはシーケンス長とバッチに比例して育つKVキャッシュです。KVキャッシュの公式とGQAがそれを何分の一かに減らす原理、プリフィル活性化とフレームワークオーバーヘッドの大きさ、PagedAttentionが消した断片化の損失、そして4bit量子化がタダではない理由を
2026-07-26 · 20 分で読めます #llm#inference#vram#kv-cache#quantization