标签: #cutlass
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
编写核函数的三个层次 — 用同一个问题比较 CUDA C++、Triton 与 CUTLASS
比较在编写同一个 GPU 核函数时,手写 CUDA C++、用 Python 按瓦片编写 Triton、用模板拼装 CUTLASS 与 CuTe 这三种方式各自带来的变化。我们实际用 CUDA C++ 和 Triton 分别编写一个按行 softmax 核函数,并排测量代码量与性能,并从编译流水线的层面解释这种差异从何而来。文章还具体说明了 Triton 为何成为自定义注意力核函数事实上的标准,以及 Triton 不擅长的具体领域。内容
2026-08-02 · 25 分钟阅读 #triton#cuda#cutlass#gpu-kernel#compiler