标签: #optimization
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
用 Hybrid SWA 优化长上下文推理 — Xiaomi MiMo v2.5 实际做了什么
把滑动窗口注意力(SWA)与全注意力按层混合的混合 SWA,是最近同时削减长上下文推理 KV 缓存内存与计算量的主流设计。本文以 Xiaomi 公开的 MiMo v2.5 推理优化文章为依据,梳理混合 SWA 是什么、为什么重要,MiMo v2.5 实际做了哪些架构与系统工程(70 层中仅 10 层全注意力、窗口 128、理论上约 7 倍削减),以及诚实地看它缺了什么。结论是与上一篇量子化文章相同的战场 — KV 缓存 — 只是从另一个
2026-07-11 · 13 分钟阅读 #ai#llm#inference#attention#optimization最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationLLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decoding深度学习训练方法完全指南:从优化到分布式训练
一份系统讲解深度学习模型高效训练全部技巧的完整指南。通过实战代码学习梯度下降法、优化器、学习率调度、正则化、批归一化、迁移学习、微调,直至分布式训练。
2026-03-17 · 38 分钟阅读 #deep-learning#training#optimization#regularization#distributed-training深度学习调试完全指南:从训练失败诊断到性能优化
系统性诊断和解决深度学习模型训练失败的完全指南。涵盖 Loss NaN、梯度消失/爆炸、过拟合、收敛缓慢、显存不足等所有常见问题的原因与解决方案,并配有实战代码。
2026-03-17 · 30 分钟阅读 #deep-learning#debugging#pytorch#training#optimizationAI/ML 论文阅读必备数学 + LaTeX/KaTeX 全面整理
全面整理阅读 AI/ML 论文时必然会遇到的数学概念(线性代数、微积分、概率统计、最优化)与 LaTeX/KaTeX 公式语法,以实战示例为核心讲解。从符号速查表、公式模式解析,到 MDX 博客渲染技巧,一次讲清楚。
2026-03-08 · 24 分钟阅读 #ai-papers#math#latex#katex#linear-algebraFlashAttention:利用 GPU 内存层级的注意力优化分析
梳理 FlashAttention 论文,详细分析利用 GPU HBM/SRAM 内存层级的 IO-aware 注意力优化原理。
2026-03-01 · 24 分钟阅读 #ai-papers#flash-attention#gpu#optimization#transformer