标签: #cuda
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
编写核函数的三个层次 — 用同一个问题比较 CUDA C++、Triton 与 CUTLASS
比较在编写同一个 GPU 核函数时,手写 CUDA C++、用 Python 按瓦片编写 Triton、用模板拼装 CUTLASS 与 CuTe 这三种方式各自带来的变化。我们实际用 CUDA C++ 和 Triton 分别编写一个按行 softmax 核函数,并排测量代码量与性能,并从编译流水线的层面解释这种差异从何而来。文章还具体说明了 Triton 为何成为自定义注意力核函数事实上的标准,以及 Triton 不擅长的具体领域。内容
2026-08-02 · 25 分钟阅读 #triton#cuda#cutlass#gpu-kernel#compilerAMD 与 NVIDIA 有何不同 — 问题不在硬件,而在软件栈
把 AMD GPU 与 NVIDIA GPU 的差异,按硬件结构、软件栈、移植路径、生态成熟度这四个层面拆开,不带感情地梳理一遍。从 SM 与 CU、Tensor Core 与 Matrix Core 的对应关系讲起,具体说明 warp 32 与 wavefront 64 到底会在代码里制造出什么样的 bug。区分 HIPIFY 能自动搬过去的部分和必须手动修改的部分,并解释在 cuBLAS 与 rocBLAS 这类库对应表中,为什么
2026-08-02 · 22 分钟阅读 #amd#rocm#hip#nvidia#cuda亲手改一个 GPU kernel 到底意味着什么 —— 把一个转置 kernel 提速 5 倍
从线程、warp、内存层级讲起,梳理亲手修改 GPU kernel 到底意味着什么。从 roofline 的视角解释为什么占用率是症状而不是目标,以及为什么大多数 kernel 受限于内存带宽而不是计算。把一个矩阵转置 kernel 从 naive 一路改到合并访问、共享内存分块、消除存储体冲突这四个阶段,并提供了在每个阶段实测有效带宽的基准测试工具。最后梳理了在 Nsight Compute 里具体该打开哪些 section、该看什么
2026-08-02 · 26 分钟阅读 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performanceRust 1.97 砍掉了 Volta 之前的 GPU — nvptx64 基线上调的内幕
Rust 1.97(2026 年 7 月 9 日)把 nvptx64-nvidia-cuda 目标的最低要求提升到了 PTX ISA 7.0(需要 CUDA 11 及以上驱动)和 SM 7.0(Volta 及以上)。Maxwell、Pascal 两代 GPU 以及 CUDA 10 及更早的驱动,如今都不再是支持目标。本文梳理了实际改变的数字、编译器团队引用的三个具体缺陷(调试符号、原子操作顺序、target-feature 机制)、谁会
2026-07-16 · 18 分钟阅读 #rust#cuda#gpu#compiler#nvidia扩散 LLM 会写 CUDA 内核 — DICE,以及并行生成为何可能有效
DICE 是 2026 年 2 月的一篇预印本,它主张扩散(diffusion)大语言模型在 CUDA 内核生成上超越了同规模的自回归(autoregressive)模型,创下了新的最高性能(SOTA)。核心思路是:与其把 token 从左到右逐个写出,不如并行生成整个序列,并可以在任意位置非顺序地改写 — 这一性质似乎很适合全局结构至关重要的代码任务。作者用一个名为 CuKe 的 SFT 数据集和两阶段强化学习(BiC-RL)训练了
2026-07-11 · 10 分钟阅读 #ai#llm#diffusion#cuda#gpu