标签: #inference
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 11 篇
推理强度不是选模型,而是逐请求决定的部署参数
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#costLLM 推理显存计算法 — 比权重先爆的是 KV cache
整理了用几次乘法回答“这个模型能装进我们的 GPU 吗”的方法。权重内存用参数量乘以每参数字节数就算完了,但真正挡住部署的是随序列长度和批大小一起长大的 KV cache。本文用数字讲清 KV cache 公式、GQA 把它压到几分之一的原理、预填充激活与框架开销的量级、PagedAttention 消除的碎片损失,以及 4bit 量化并不免费的理由,并附上一个从现有显存反推可并发序列数的计算器函数。
2026-07-26 · 16 分钟阅读 #llm#inference#vram#kv-cache#quantizationPD 分离并不会提升吞吐量 — 预填充/解码分离实际买到的是什么
把预填充和解码拆到不同 GPU 上的 PD 分离,是 2026 年 vLLM、SGLang、TensorRT-LLM 都已经引入的设计,但无论从哪里看,流传的都只是"2 倍到 7 倍"这样的数字。然而 vLLM 官方文档却用大写字母把同一个功能钉死为"分离式预填充并不会提升吞吐量"。两者其实都对 — 因为那些厂商数字测的从来都不是吞吐量,而是 goodput(满足 SLO 的处理量),或者是在固定延迟目标条件下的吞吐量。本文梳理 PD
2026-07-16 · 25 分钟阅读 #llm#ai#inference#kv-cache#vllm用 Hybrid SWA 优化长上下文推理 — Xiaomi MiMo v2.5 实际做了什么
把滑动窗口注意力(SWA)与全注意力按层混合的混合 SWA,是最近同时削减长上下文推理 KV 缓存内存与计算量的主流设计。本文以 Xiaomi 公开的 MiMo v2.5 推理优化文章为依据,梳理混合 SWA 是什么、为什么重要,MiMo v2.5 实际做了哪些架构与系统工程(70 层中仅 10 层全注意力、窗口 128、理论上约 7 倍削减),以及诚实地看它缺了什么。结论是与上一篇量子化文章相同的战场 — KV 缓存 — 只是从另一个
2026-07-11 · 13 分钟阅读 #ai#llm#inference#attention#optimizationMac mini 为何成为端侧 AI 机器 — Apple Silicon 高管访谈说了什么、没说什么
Apple Silicon 高级产品经理道格·布鲁克斯(Doug Brooks)在 The Deep View 的访谈中谈到了 Mac mini 与 Mac Studio 的需求以及端侧 AI 的走向。开发者和小型团队为何选择这台小小的台式机作为本地 LLM 与智能体机器、统一内存架构的真正优势是什么,以及 CUDA 生态差距与近期涨价这一诚实的取舍 — 本文原样引用高管的发言,同时剥离营销话术加以梳理。
2026-07-11 · 9 分钟阅读 #apple-silicon#on-device-ai#local-llm#mac-mini#inferenceKV 缓存降到 4 比特 — SAW-INT4 与系统感知的 INT4 量化
在长上下文 LLM 服务中,真正的内存瓶颈不是权重,而是 KV 缓存。直接把它降到 INT4 会让精度崩溃,但 2026 年 4 月的预印本 SAW-INT4 报告说,在逐 token 的 INT4 量化之上再叠加块对角阿达玛旋转,就能几乎追回朴素 INT4 丢掉的精度。这篇论文真正的角度不只是精度,而是吞吐量 — 通过直接集成进分页 KV 缓存布局的融合旋转·量化内核,作者们称没有可测量的端到端开销,吞吐量与纯 INT4 相同。向量量
2026-07-11 · 11 分钟阅读 #ai#llm#quantization#inference#kv-cache想得更多不等于答得更对:测试时计算与过度思考
2026年4月,Shu Zhou 等6人在 "When More Thinking Hurts" 中,对一味增加推理 token 的潮流正面提出质疑。据作者们报告,计算预算越大,额外推理 token 的边际效用就下降得越多,而从某个点开始,模型会陷入"过度思考",亲手推翻自己此前已经答对的答案。最优思考长度因问题难度而各不相同,因此给所有问题相同预算的做法并不高效。摘要并未给出具体的模型名称或数值,所以我只谨慎地带回方向性。
2026-07-11 · 10 分钟阅读 #ai#llm#reasoning#inference#test-time-computeLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationLLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decodingAI Papers: Test-Time Scaling 核心论文梳理 — 用推理预算提升性能的方法
Test-Time Scaling(TTS)不增加训练参数,而是通过增加推理阶段的计算预算来提升性能。本文从论文脉络与实务应用的角度,梳理 Best-of-N、Self-Consistency、Tree Search、以及基于 Verifier/Reranker 的方法。
2026-03-04 · 22 分钟阅读 #ai-papers#test-time-scaling#reasoning#inference#llm