タグ: #LLMサービング
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
NVIDIA GPUとCUDAの完全解剖:なぜGPUがAIを支配するのか
H100のハードウェア仕様からTensor Core WMMA APIまで。SIMTの実行モデル、共有メモリタイリング、Warp Divergenceを実際のCUDAコードとともに完全解剖する。
2026-03-18 · 20 分で読めます #cuda#gpu#nvidia#行列演算#並列コンピューティングLLM サービング最適化完全ガイド:KVキャッシュ、PagedAttention、量子化のすべて
LLMサービングの核心最適化技術を完全解剖する。KVキャッシュのメモリ問題からPagedAttentionの仮想メモリ革新、連続バッチング、投機的デコーディング、量子化、そしてvLLM/TGI/TensorRT-LLMの比較まで。
2026-03-18 · 44 分で読めます #LLMサービング#KVキャッシュ#paged-attention#vllm#量子化cuDNN完全解剖:なぜ深層学習演算はGPU上で光速なのか
im2col変換からWinogradアルゴリズム、FlashAttentionのタイリング、TensorRT INT8量子化まで。cuDNNが深層学習演算を10〜100倍高速化する仕組みを実際のコードとともに完全解剖する。
2026-03-18 · 19 分で読めます #cudnn#gpu#深層学習最適化#畳み込み#LLMサービング行列はGPUでどう飛び回るか:GEMMからFlashAttentionまで完全解剖
深層学習演算の80%以上を占める行列乗算がGPU上でどのように最適化されるか。ナイーブなO(n³)実装からキャッシュブロッキング、cuBLAS、テンソルコア、そしてFlashAttentionのIO-aware革新まで完全に解剖する。
2026-03-18 · 17 分で読めます #gemm#行列乗算#flash-attention#gpu#並列コンピューティングGoogle TPU完全解剖:Systolic Arrayが行列乗算をいかに完璧に解くか
Google TPUの核心技術であるSystolic Arrayが行列乗算をどのように極限まで最適化するかを完全解剖。INT8推論からbfloat16、XLAコンパイラ、TPU Podでの分散推論まで、実際の数値とコードで深掘りします。
2026-03-18 · 20 分で読めます #tpu#google#シストリックアレイ#LLMサービング#jaxApple SiliconでLLMを動かす:M4/M5チップのAI推論の秘密と限界
Apple M4/M5チップのユニファイドメモリアーキテクチャがLLM推論に与える影響を深く掘り下げます。Neural Engine、MLXフレームワーク、llama.cpp Metalバックエンドを使った実測ベンチマークと、NVIDIAとの正直な比較を提供します。
2026-03-18 · 18 分で読めます #apple-silicon#m5#LLMサービング#ユニファイドメモリ#mlxAMD GPU & ROCm完全分析:LLM推論でCUDAに挑めるか?
AMD MI300X の192GB HBM3メモリ、ROCmソフトウェアスタック、HIPプログラミングモデルを徹底解析。vLLMとllama.cppを使った実測LLMサービングベンチマークと、NVIDIA CUDAへの正直な強み・弱み比較を提供します。
2026-03-18 · 19 分で読めます #amd#rocm#gpu#mi300x#LLMサービング