タグ: #distributed-training
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 16 件
SlurmでGPUクラスタを使う — 提出より大事なのはなぜ動かないかを知ること
GPUクラスタでSlurmを実務で使うのに必要なことだけを整理しました。パーティション、QoS、アカウントという座標系をまず立て、sbatchスクリプトでGPUとCPU、メモリを要求する方法とその間のバインディングの落とし穴を扱います。マルチノード学習をsrunとランデブーで立ち上げる二つのパターンを実際に動くスクリプトで提示し、配列ジョブと依存関係チェーンでスイープと再開をスケジューラに任せる方法も入れました。後半はすべて失敗事例です
2026-08-02 · 22 分で読めます #mlops#slurm#hpc#gpu-cluster#distributed-trainingマルチGPU学習の四つの並列化 — 何を分割し、何を通信するか
データ並列、テンソル並列、パイプライン並列、コンテキスト並列がそれぞれ何を分割し、その代償として何を通信するのかを数字で整理しました。まずAdam混合精度学習のパラメータあたり16バイトの内訳を組み立て、ZeROステージ1〜3がその内訳のどの項をGPU数で割るのかを計算します。続いて活性化メモリの計算式でチェックポインティングがなぜ100GBを1GBに変えるのかを確認し、各並列化の通信量をステップあたりバイト数に換算して、NVLink内
2026-08-02 · 21 分で読めます #mlops#distributed-training#multi-gpu#fsdp#deepspeedPyTorch 2.13のtorchcomms — c10dを置き換えにきた新しい分散通信バックエンド
2026年7月8日にリリースされたPyTorch 2.13のハイライトのうち、最も構造的な変化はtorchcomms — PyTorch Distributedの新しい通信バックエンドが、コアのCIとDeviceMeshの経路に統合され始めたことです。torchcommsは2025年10月にMetaが発表した実験的な通信APIで、グローバル状態ベースのc10d ProcessGroupの技術的負債(NCCL中心の設計、lazy init
2026-07-17 · 18 分で読めます #pytorch#distributed-training#nccl#deep-learningKubernetes v1.36 の Workload/PodGroup API — ギャングスケジューリングが kube-scheduler に入りつつある
AI学習・バッチワークロードのギャングスケジューリングは、これまでVolcanoやKueueといった外部スケジューラの仕事でしたが、Kubernetesはこの機能をコアに取り込み始めています。v1.35はWorkload APIと最初のギャングスケジューリング実装をアルファとして出し、2026年4月22日リリースのv1.36は構造を作り直し、Workloadを静的テンプレートに、新しいPodGroupをランタイムオブジェクトに分離して、
2026-07-16 · 33 分で読めます #kubernetes#scheduling#gang-scheduling#distributed-training#draマルチGPU・マルチノード学習プラットフォーム総まとめ — フレームワークの地図からSlurm・Kubeflow実践ガイドまで
GPU複数枚・ノード複数台でモデルを学習させる全体の地形を1枚に整理します。AIライブラリ・フレームワークのエコシステム地図(PyTorch・JAX・HuggingFace・DeepSpeed・Ray)、並列化戦略(DDP・FSDP・ZeRO・TP・PP)をいつ何で選ぶか、torchrunの単一ノードからマルチノードへの拡張、HPC標準であるSlurmの使い方ガイド(sbatchスクリプトとマルチノードtorchrunの連携)、Kube
2026-07-09 · 11 分で読めます #ai#ml#distributed-training#slurm#kubeflowAIインターコネクト — NVLink、NVSwitch、UALink、そしてスケールアップの技術
大規模なAI学習と推論における本当のボトルネックは、演算ではなく通信です。NVLinkとNVSwitchが作るスケールアップドメイン、GB200 NVL72のようなラックスケールシステム、そしてUALinkやUltra Ethernetといったオープンな代替まで、AIインターコネクトの原理と実務を整理します。
2026-06-16 · 51 分で読めます #gpu-cuda#nvlink#nvswitch#ualink#interconnect分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayTorch-Titan完全ガイド:PyTorchによる大規模分散学習のすべて
PyTorch Titan(torchtitan)を使った大規模LLM分散学習の完全ガイド。FSDP2、パイプライン並列、テンソル並列、4D並列、Flash Attention、混合精度を実践的な例とともに解説します。
2026-03-17 · 25 分で読めます #torch-titan#distributed-training#pytorch#fsdp#deep-learning大規模モデルトレーニング完全ガイド:1000億パラメータ超LLM事前学習の実践戦略
1000億パラメータ超LLMの事前学習を完全解説。スケーリング則(Chinchilla)、Megatron-LM、3D並列化、チェックポイント戦略、学習安定性、データ混合まで実践例とともに徹底解説。
2026-03-17 · 26 分で読めます #large-scale-training#llm#megatron-lm#distributed-training#scaling-laws連合学習完全ガイド: プライバシー保護分散AI
連合学習(Federated Learning)の完全ガイド。データプライバシーを保護しながら分散モデルを学習する方法を解説。FedAvg、FedProx、差分プライバシー、Flowerフレームワークまで実践コード付き。
2026-03-17 · 26 分で読めます #federated-learning#privacy#distributed-training#differential-privacy#aiDeepSpeed完全ガイド:ZeRO最適化と大規模モデル訓練
Microsoft DeepSpeedを完全マスターするための包括的ガイド。ZeRO-1/2/3最適化、Offload、パイプライン並列、混合精度、MoE、DeepSpeed Inferenceを実践的な設定とコード例と共に学ぶ。
2026-03-17 · 20 分で読めます #deepspeed#zero-optimization#distributed-training#llm#pytorchディープラーニング学習手法完全ガイド: 最適化から分散学習まで
ディープラーニングモデルを効果的に学習するためのすべての技術を網羅する完全ガイド。勾配降下法、オプティマイザー、学習率スケジューリング、正則化、バッチ正規化、転移学習、ファインチューニング、分散学習を実践的なコード例と共に解説。
2026-03-17 · 35 分で読めます #deep-learning#training#optimization#regularization#distributed-trainingRing Attention 論文分析:分散環境での無限コンテキストウィンドウトレーニング実装
Ring Attention論文を分析し、分散環境でコンテキスト長の制限を克服する方法を探求します。Blockwise Parallel Transformerとの関連、実装の詳細、パフォーマンスベンチマーク、プロダクション適用時の考慮事項まで扱います。
2026-03-08 · 51 分で読めます #ai-papers#ring-attention#distributed-training#long-context#transformerマルチGPU分散学習完全ガイド: DDP、FSDP、DeepSpeed
PyTorch公式ドキュメントに基づき、DDP、FSDP、DeepSpeed ZeROなどマルチGPU分散学習のコアコンポーネントを体系的に分析し、実践的なセットアップ手順を解説します。
2026-03-01 · 33 分で読めます #gpu#cuda#distributed-training#deep-learning#pytorchSlurm 完全攻略:HPC/AI クラスター ワークロードマネージャー実践ガイド
Slurm ワークロードマネージャーを完全攻略する。アーキテクチャ(slurmctld/slurmd/slurmdbd)、中核概念(パーティション/QoS/Fairshare)、必須コマンド(sbatch/srun/salloc)、GPU スケジューリング(GRES/MIG/MPS)、マルチノード分散学習(PyTorch DDP/DeepSpeed/Horovod)、コンテナ統合(Singularity/Enroot+Pyxis)、設定
2026-03-01 · 18 分で読めます #slurm#hpc#gpu#distributed-training#clusterKubernetes AI学習パイプライン:Volcano、Training Operator、Kueueの徹底分析
Volcano、Kubeflow Training Operator、Kueueの公式ドキュメントに基づき、Kubernetes上での分散AI学習パイプラインの構築方法を分析する。
2026-03-01 · 31 分で読めます #kubernetes#ai#distributed-training#volcano#kubeflow