タグ: #並列コンピューティング
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
NVIDIA GPUとCUDAの完全解剖:なぜGPUがAIを支配するのか
H100のハードウェア仕様からTensor Core WMMA APIまで。SIMTの実行モデル、共有メモリタイリング、Warp Divergenceを実際のCUDAコードとともに完全解剖する。
2026-03-18 · 20 分で読めます #cuda#gpu#nvidia#行列演算#並列コンピューティング行列はGPUでどう飛び回るか:GEMMからFlashAttentionまで完全解剖
深層学習演算の80%以上を占める行列乗算がGPU上でどのように最適化されるか。ナイーブなO(n³)実装からキャッシュブロッキング、cuBLAS、テンソルコア、そしてFlashAttentionのIO-aware革新まで完全に解剖する。
2026-03-18 · 17 分で読めます #gemm#行列乗算#flash-attention#gpu#並列コンピューティング