タグ: #deepspeed
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
マルチGPU学習の四つの並列化 — 何を分割し、何を通信するか
データ並列、テンソル並列、パイプライン並列、コンテキスト並列がそれぞれ何を分割し、その代償として何を通信するのかを数字で整理しました。まずAdam混合精度学習のパラメータあたり16バイトの内訳を組み立て、ZeROステージ1〜3がその内訳のどの項をGPU数で割るのかを計算します。続いて活性化メモリの計算式でチェックポインティングがなぜ100GBを1GBに変えるのかを確認し、各並列化の通信量をステップあたりバイト数に換算して、NVLink内
2026-08-02 · 21 分で読めます #mlops#distributed-training#multi-gpu#fsdp#deepspeedLLMファインチューニングフレームワーク2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 徹底ガイド
2026年のLLMファインチューニング生態系を一気に整理する。Axolotl・Unsloth・LLaMA-Factory・TRL・PEFT・TorchTuneといったオープンソースフレームワークから、LLM Foundry(MosaicML、Databricksが買収)、Modal・Together・OpenAI・Anthropic・Cohereのクラウドファインチューニング API まで。QLoRA・FSDP・DeepSpeed Ze
2026-05-16 · 37 分で読めます #llm#finetuning#axolotl#unsloth#llama-factory分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayAI 推論エンジン 2026 完全ガイド - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 徹底解剖
2026 年の LLM エンジニアリングはもうモデル選定の問題ではなく、エンジン選定の問題になった。vLLM V1、SGLang 0.4、TensorRT-LLM、TGI 3.x、llama.cpp、MLX-LM、mistral.rs、DeepSpeed-MII、Aphrodite、CTranslate2、ExLlamaV3、OpenVINO、AWS Neuron、Triton — 10 以上のエンジンを PagedAttention・
2026-05-16 · 26 分で読めます #llm-inference#vllm#sglang#llama-cpp#tgiDeepSpeed完全ガイド:ZeRO最適化と大規模モデル訓練
Microsoft DeepSpeedを完全マスターするための包括的ガイド。ZeRO-1/2/3最適化、Offload、パイプライン並列、混合精度、MoE、DeepSpeed Inferenceを実践的な設定とコード例と共に学ぶ。
2026-03-17 · 20 分で読めます #deepspeed#zero-optimization#distributed-training#llm#pytorchSlurm 完全攻略:HPC/AI クラスター ワークロードマネージャー実践ガイド
Slurm ワークロードマネージャーを完全攻略する。アーキテクチャ(slurmctld/slurmd/slurmdbd)、中核概念(パーティション/QoS/Fairshare)、必須コマンド(sbatch/srun/salloc)、GPU スケジューリング(GRES/MIG/MPS)、マルチノード分散学習(PyTorch DDP/DeepSpeed/Horovod)、コンテナ統合(Singularity/Enroot+Pyxis)、設定
2026-03-01 · 18 分で読めます #slurm#hpc#gpu#distributed-training#cluster