タグ: #fsdp
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
マルチGPU学習の四つの並列化 — 何を分割し、何を通信するか
データ並列、テンソル並列、パイプライン並列、コンテキスト並列がそれぞれ何を分割し、その代償として何を通信するのかを数字で整理しました。まずAdam混合精度学習のパラメータあたり16バイトの内訳を組み立て、ZeROステージ1〜3がその内訳のどの項をGPU数で割るのかを計算します。続いて活性化メモリの計算式でチェックポインティングがなぜ100GBを1GBに変えるのかを確認し、各並列化の通信量をステップあたりバイト数に換算して、NVLink内
2026-08-02 · 21 分で読めます #mlops#distributed-training#multi-gpu#fsdp#deepspeedLLMファインチューニングフレームワーク2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 徹底ガイド
2026年のLLMファインチューニング生態系を一気に整理する。Axolotl・Unsloth・LLaMA-Factory・TRL・PEFT・TorchTuneといったオープンソースフレームワークから、LLM Foundry(MosaicML、Databricksが買収)、Modal・Together・OpenAI・Anthropic・Cohereのクラウドファインチューニング API まで。QLoRA・FSDP・DeepSpeed Ze
2026-05-16 · 37 分で読めます #llm#finetuning#axolotl#unsloth#llama-factory分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayTorch-Titan完全ガイド:PyTorchによる大規模分散学習のすべて
PyTorch Titan(torchtitan)を使った大規模LLM分散学習の完全ガイド。FSDP2、パイプライン並列、テンソル並列、4D並列、Flash Attention、混合精度を実践的な例とともに解説します。
2026-03-17 · 25 分で読めます #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 内部構造 & 高度な最適化: autograd、torch.compile、FSDP、Tritonまで
PyTorch autograd エンジン、torch.compile() と TorchInductor 最適化、FSDP 分散学習、gradient checkpointing、カスタム CUDA 演算まで、PyTorch 完全攻略ガイドです。
2026-03-17 · 14 分で読めます #pytorch#torch-compile#fsdp#triton#混合精度