标签: #attention
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
用 Hybrid SWA 优化长上下文推理 — Xiaomi MiMo v2.5 实际做了什么
把滑动窗口注意力(SWA)与全注意力按层混合的混合 SWA,是最近同时削减长上下文推理 KV 缓存内存与计算量的主流设计。本文以 Xiaomi 公开的 MiMo v2.5 推理优化文章为依据,梳理混合 SWA 是什么、为什么重要,MiMo v2.5 实际做了哪些架构与系统工程(70 层中仅 10 层全注意力、窗口 128、理论上约 7 倍削减),以及诚实地看它缺了什么。结论是与上一篇量子化文章相同的战场 — KV 缓存 — 只是从另一个
2026-07-11 · 13 分钟阅读 #ai#llm#inference#attention#optimizationAttention Is All You Need:Transformer 论文完全解析
对 Transformer 架构的核心论文「Attention Is All You Need」的深入解析,逐一拆解 Self-Attention、Multi-Head Attention、Positional Encoding 等核心机制。
2026-03-01 · 23 分钟阅读 #ai-papers#transformer#deep-learning#attention