标签: #memory-bandwidth
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
亲手改一个 GPU kernel 到底意味着什么 —— 把一个转置 kernel 提速 5 倍
从线程、warp、内存层级讲起,梳理亲手修改 GPU kernel 到底意味着什么。从 roofline 的视角解释为什么占用率是症状而不是目标,以及为什么大多数 kernel 受限于内存带宽而不是计算。把一个矩阵转置 kernel 从 naive 一路改到合并访问、共享内存分块、消除存储体冲突这四个阶段,并提供了在每个阶段实测有效带宽的基准测试工具。最后梳理了在 Nsight Compute 里具体该打开哪些 section、该看什么
2026-08-02 · 26 分钟阅读 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performance