标签: #vram
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
LLM 推理显存计算法 — 比权重先爆的是 KV cache
整理了用几次乘法回答“这个模型能装进我们的 GPU 吗”的方法。权重内存用参数量乘以每参数字节数就算完了,但真正挡住部署的是随序列长度和批大小一起长大的 KV cache。本文用数字讲清 KV cache 公式、GQA 把它压到几分之一的原理、预填充激活与框架开销的量级、PagedAttention 消除的碎片损失,以及 4bit 量化并不免费的理由,并附上一个从现有显存反推可并发序列数的计算器函数。
2026-07-26 · 16 分钟阅读 #llm#inference#vram#kv-cache#quantization