タグ: #cutlass
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
カーネルを書く三つの層 — CUDA C++、Triton、CUTLASSを同じ問題で比較する
同じGPUカーネルを、手で書くCUDA C++、Pythonでタイル単位に書くTriton、テンプレートで組み立てるCUTLASSとCuTeでそれぞれ書いたとき、何が変わるのかを比較します。行単位のsoftmaxをCUDA C++とTritonで実際に書いてコード量と性能を並べて測り、その差がどこから来るのかをコンパイルパイプラインのレベルで説明します。Tritonがカスタムアテンションカーネルの事実上の標準になった理由とあわせて、Tr
2026-08-02 · 28 分で読めます #triton#cuda#cutlass#gpu-kernel#compiler