标签: #triton
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
编写核函数的三个层次 — 用同一个问题比较 CUDA C++、Triton 与 CUTLASS
比较在编写同一个 GPU 核函数时,手写 CUDA C++、用 Python 按瓦片编写 Triton、用模板拼装 CUTLASS 与 CuTe 这三种方式各自带来的变化。我们实际用 CUDA C++ 和 Triton 分别编写一个按行 softmax 核函数,并排测量代码量与性能,并从编译流水线的层面解释这种差异从何而来。文章还具体说明了 Triton 为何成为自定义注意力核函数事实上的标准,以及 Triton 不擅长的具体领域。内容
2026-08-02 · 25 分钟阅读 #triton#cuda#cutlass#gpu-kernel#compilerGPU 编译器与框架全景图 — 接收计算图、产出核函数,同一个问题,每一层给出不同的答案
本文把 NVCC 与 PTX、LLVM、MLIR、Triton、torch.compile、XLA、IREE、TVM 全部放到同一张地图上。它们名字不同、所属组织也不同,但解决的是同一个问题:接收计算图,产出可执行的核函数。文章梳理了每一层切走了这个问题的哪一部分、层为什么会变得这么多,以及工程师在什么情况下需要下探到哪一层。内容基于 2026 年 8 月 2 日核实的版本与官方文档写成,未能核实之处也如实标出。
2026-08-02 · 32 分钟阅读 #gpu#compiler#mlir#triton#pytorchTriton Gluon — 把编译器藏起来的布局,重新用手写出来的语言
Gluon 是搭建在 Triton 同一套编译器栈之上的底层 GPU 语言,它把 Triton 一直藏起来的布局、共享内存、warp 特化,原样交还给写内核的人。它存在的理由很明确 — 当 Triton 编译器生成的代码不够好时,过去你根本没有办法插手。本文会追踪 Gluon 到底暴露了什么、BlockedLayout 具体意味着什么,以及上游教程在 GB200 上记录的测量值(同一个 memcpy,仅凭一个布局,就能在 0.774 T
2026-07-16 · 28 分钟阅读 #gpu#triton#kernel#compiler#performancePyTorch 内部结构与高级优化:从 autograd、torch.compile、FSDP 到 Triton
一份 PyTorch 完全攻略指南,涵盖 PyTorch autograd 引擎、torch.compile() 与 TorchInductor 优化、FSDP 分布式训练、gradient checkpointing,以及自定义 CUDA 算子。
2026-03-17 · 13 分钟阅读 #pytorch#torch-compile#fsdp#triton#혼합정밀도NVIDIA Triton Inference Server 生产指南:GPU 模型服务优化策略
基于 NVIDIA Triton Inference Server 的 GPU 模型服务优化指南。涵盖 Dynamic Batching、Model Ensemble、TensorRT 集成、多模型服务、Kubernetes 部署、性能画像分析与生产环境故障排查。
2026-03-08 · 38 分钟阅读 #ai-platform#triton#inference-server#gpu#model-servingKubernetes ML 模型服务:KServe 与 NVIDIA Triton 完全解析
基于 KServe 与 NVIDIA Triton 官方文档,系统性地分析 Kubernetes 环境下的 ML 模型服务架构。
2026-03-01 · 25 分钟阅读 #mlops#kubernetes#model-serving#kserve#triton