タグ: #gemm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
行列はGPUでどう飛び回るか:GEMMからFlashAttentionまで完全解剖
深層学習演算の80%以上を占める行列乗算がGPU上でどのように最適化されるか。ナイーブなO(n³)実装からキャッシュブロッキング、cuBLAS、テンソルコア、そしてFlashAttentionのIO-aware革新まで完全に解剖する。
2026-03-18 · 17 分で読めます #gemm#行列乗算#flash-attention#gpu#並列コンピューティング