标签: #kv-cache
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
LLM 推理显存计算法 — 比权重先爆的是 KV cache
整理了用几次乘法回答“这个模型能装进我们的 GPU 吗”的方法。权重内存用参数量乘以每参数字节数就算完了,但真正挡住部署的是随序列长度和批大小一起长大的 KV cache。本文用数字讲清 KV cache 公式、GQA 把它压到几分之一的原理、预填充激活与框架开销的量级、PagedAttention 消除的碎片损失,以及 4bit 量化并不免费的理由,并附上一个从现有显存反推可并发序列数的计算器函数。
2026-07-26 · 16 分钟阅读 #llm#inference#vram#kv-cache#quantization在本地跑 LLM 到底需要多少 VRAM — 别查表,用公式算
「8B 模型需要几 GB」这个问题的正确答案不是一张表,而是两个公式。权重是参数量乘以 bpw 除以 8;KV 缓存是 2 乘以层数乘以 KV 头数乘以 headdim 乘以字节数乘以 token 数。本文把这两个公式直接对照 llama.cpp 的源代码与官方表格来验证 — 从 ggml 块结构体推导出的 Q80 的 8.5 bpw,与 llama.cpp 发布的 8.5008 吻合到小数点后第三位;用同样的方式反推出的参数量为 8.
2026-07-17 · 34 分钟阅读 #llm#quantization#kv-cache#local-llm#gpuPD 分离并不会提升吞吐量 — 预填充/解码分离实际买到的是什么
把预填充和解码拆到不同 GPU 上的 PD 分离,是 2026 年 vLLM、SGLang、TensorRT-LLM 都已经引入的设计,但无论从哪里看,流传的都只是"2 倍到 7 倍"这样的数字。然而 vLLM 官方文档却用大写字母把同一个功能钉死为"分离式预填充并不会提升吞吐量"。两者其实都对 — 因为那些厂商数字测的从来都不是吞吐量,而是 goodput(满足 SLO 的处理量),或者是在固定延迟目标条件下的吞吐量。本文梳理 PD
2026-07-16 · 25 分钟阅读 #llm#ai#inference#kv-cache#vllmKV 缓存降到 4 比特 — SAW-INT4 与系统感知的 INT4 量化
在长上下文 LLM 服务中,真正的内存瓶颈不是权重,而是 KV 缓存。直接把它降到 INT4 会让精度崩溃,但 2026 年 4 月的预印本 SAW-INT4 报告说,在逐 token 的 INT4 量化之上再叠加块对角阿达玛旋转,就能几乎追回朴素 INT4 丢掉的精度。这篇论文真正的角度不只是精度,而是吞吐量 — 通过直接集成进分页 KV 缓存布局的融合旋转·量化内核,作者们称没有可测量的端到端开销,吞吐量与纯 INT4 相同。向量量
2026-07-11 · 11 分钟阅读 #ai#llm#quantization#inference#kv-cacheLLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decodingKV Cache 优化深度解析:GQA、MLA、MHA 注意力机制与内存效率化策略
从 Transformer Self-Attention 的 KV Cache 基本原理出发,深入分析并比较 MHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)机制的内存占用,涵盖 KV Cache 压缩技术(量化、驱逐策略、滑动窗口)、PagedAttention(vLLM)实现、PyTorch 代码示例、OOM 故障案例与优化清单。
2026-03-11 · 22 分钟阅读 #ai-papers#kv-cache#attention-mechanism#gqa#mla