タグ: #slurm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
SlurmでGPUクラスタを使う — 提出より大事なのはなぜ動かないかを知ること
GPUクラスタでSlurmを実務で使うのに必要なことだけを整理しました。パーティション、QoS、アカウントという座標系をまず立て、sbatchスクリプトでGPUとCPU、メモリを要求する方法とその間のバインディングの落とし穴を扱います。マルチノード学習をsrunとランデブーで立ち上げる二つのパターンを実際に動くスクリプトで提示し、配列ジョブと依存関係チェーンでスイープと再開をスケジューラに任せる方法も入れました。後半はすべて失敗事例です
2026-08-02 · 22 分で読めます #mlops#slurm#hpc#gpu-cluster#distributed-trainingマルチGPU・マルチノード学習プラットフォーム総まとめ — フレームワークの地図からSlurm・Kubeflow実践ガイドまで
GPU複数枚・ノード複数台でモデルを学習させる全体の地形を1枚に整理します。AIライブラリ・フレームワークのエコシステム地図(PyTorch・JAX・HuggingFace・DeepSpeed・Ray)、並列化戦略(DDP・FSDP・ZeRO・TP・PP)をいつ何で選ぶか、torchrunの単一ノードからマルチノードへの拡張、HPC標準であるSlurmの使い方ガイド(sbatchスクリプトとマルチノードtorchrunの連携)、Kube
2026-07-09 · 11 分で読めます #ai#ml#distributed-training#slurm#kubeflowSlurm 完全攻略:HPC/AI クラスター ワークロードマネージャー実践ガイド
Slurm ワークロードマネージャーを完全攻略する。アーキテクチャ(slurmctld/slurmd/slurmdbd)、中核概念(パーティション/QoS/Fairshare)、必須コマンド(sbatch/srun/salloc)、GPU スケジューリング(GRES/MIG/MPS)、マルチノード分散学習(PyTorch DDP/DeepSpeed/Horovod)、コンテナ統合(Singularity/Enroot+Pyxis)、設定
2026-03-01 · 18 分で読めます #slurm#hpc#gpu#distributed-training#cluster