タグ: #行列乗算
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
行列はGPUでどう飛び回るか:GEMMからFlashAttentionまで完全解剖
深層学習演算の80%以上を占める行列乗算がGPU上でどのように最適化されるか。ナイーブなO(n³)実装からキャッシュブロッキング、cuBLAS、テンソルコア、そしてFlashAttentionのIO-aware革新まで完全に解剖する。
2026-03-18 · 17 分で読めます #gemm#行列乗算#flash-attention#gpu#並列コンピューティングGoogle TPU完全解剖:Systolic Arrayが行列乗算をいかに完璧に解くか
Google TPUの核心技術であるSystolic Arrayが行列乗算をどのように極限まで最適化するかを完全解剖。INT8推論からbfloat16、XLAコンパイラ、TPU Podでの分散推論まで、実際の数値とコードで深掘りします。
2026-03-18 · 20 分で読めます #tpu#google#シストリックアレイ#LLMサービング#jax