タグ: #深層学習
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
NVIDIA GPUとCUDAの完全解剖:なぜGPUがAIを支配するのか
H100のハードウェア仕様からTensor Core WMMA APIまで。SIMTの実行モデル、共有メモリタイリング、Warp Divergenceを実際のCUDAコードとともに完全解剖する。
2026-03-18 · 20 分で読めます #cuda#gpu#nvidia#行列演算#並列コンピューティングAMD GPU & ROCm完全分析:LLM推論でCUDAに挑めるか?
AMD MI300X の192GB HBM3メモリ、ROCmソフトウェアスタック、HIPプログラミングモデルを徹底解析。vLLMとllama.cppを使った実測LLMサービングベンチマークと、NVIDIA CUDAへの正直な強み・弱み比較を提供します。
2026-03-18 · 19 分で読めます #amd#rocm#gpu#mi300x#LLMサービング