タグ: #multi-gpu
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
マルチGPU学習の四つの並列化 — 何を分割し、何を通信するか
データ並列、テンソル並列、パイプライン並列、コンテキスト並列がそれぞれ何を分割し、その代償として何を通信するのかを数字で整理しました。まずAdam混合精度学習のパラメータあたり16バイトの内訳を組み立て、ZeROステージ1〜3がその内訳のどの項をGPU数で割るのかを計算します。続いて活性化メモリの計算式でチェックポインティングがなぜ100GBを1GBに変えるのかを確認し、各並列化の通信量をステップあたりバイト数に換算して、NVLink内
2026-08-02 · 21 分で読めます #mlops#distributed-training#multi-gpu#fsdp#deepspeed