タグ: #gpu-kernel
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
カーネルを書く三つの層 — CUDA C++、Triton、CUTLASSを同じ問題で比較する
同じGPUカーネルを、手で書くCUDA C++、Pythonでタイル単位に書くTriton、テンプレートで組み立てるCUTLASSとCuTeでそれぞれ書いたとき、何が変わるのかを比較します。行単位のsoftmaxをCUDA C++とTritonで実際に書いてコード量と性能を並べて測り、その差がどこから来るのかをコンパイルパイプラインのレベルで説明します。Tritonがカスタムアテンションカーネルの事実上の標準になった理由とあわせて、Tr
2026-08-02 · 28 分で読めます #triton#cuda#cutlass#gpu-kernel#compilerGPUカーネルを自分の手で直すということ — 転置カーネルを5倍速くするまで
GPUカーネルを直接修正するとは実際どういうことか、スレッド・ワープ・メモリ階層から押さえます。占有率がなぜ目標ではなく症状なのか、そしてほとんどのカーネルが演算ではなくメモリ帯域幅に律速されているという事実をルーフラインの観点から説明します。行列転置カーネルひとつをnaiveからコアレッシング、シェアードメモリタイリング、バンクコンフリクト除去まで四段階で直しながら、各段階の有効帯域幅を実際に測るハーネスも提供します。最後にNsigh
2026-08-02 · 31 分で読めます #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performance