标签: #flash-attention
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
FlashAttention 论文解析:用 IO-Aware Exact Attention 革新 Transformer 训练与推理速度
深入解析 FlashAttention 系列(v1~v3)核心论文。涵盖 IO-Aware 算法的 tiling 策略、GPU SRAM/HBM 内存层级的利用、反向传播的 recomputation、FlashAttention-2 的并行化改进,以及 FlashAttention-3 的 FP8 支持与异步流水线,并配有实战基准测试。
2026-03-09 · 29 分钟阅读 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismFlashAttention:利用 GPU 内存层级的注意力优化分析
梳理 FlashAttention 论文,详细分析利用 GPU HBM/SRAM 内存层级的 IO-aware 注意力优化原理。
2026-03-01 · 24 分钟阅读 #ai-papers#flash-attention#gpu#optimization#transformer