タグ: #hpc
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
SlurmでGPUクラスタを使う — 提出より大事なのはなぜ動かないかを知ること
GPUクラスタでSlurmを実務で使うのに必要なことだけを整理しました。パーティション、QoS、アカウントという座標系をまず立て、sbatchスクリプトでGPUとCPU、メモリを要求する方法とその間のバインディングの落とし穴を扱います。マルチノード学習をsrunとランデブーで立ち上げる二つのパターンを実際に動くスクリプトで提示し、配列ジョブと依存関係チェーンでスイープと再開をスケジューラに任せる方法も入れました。後半はすべて失敗事例です
2026-08-02 · 22 分で読めます #mlops#slurm#hpc#gpu-cluster#distributed-trainingWEKA高性能ストレージ完全ガイド2025:AI/HPC向け並列ファイルシステム
WEKAの全て!並列ファイルシステムアーキテクチャ、NVMeティアリング、GPU Direct Storage、AI/MLワークロード最適化、クラウド連携(AWS/Azure/GCP)、Ceph/Lustre/GPFS比較、データパイプライン、性能ベンチマーク。
2026-03-25 · 24 分で読めます #weka#wekafs#storage#parallel-filesystem#ai-infrastructureSlurm 完全攻略:HPC/AI クラスター ワークロードマネージャー実践ガイド
Slurm ワークロードマネージャーを完全攻略する。アーキテクチャ(slurmctld/slurmd/slurmdbd)、中核概念(パーティション/QoS/Fairshare)、必須コマンド(sbatch/srun/salloc)、GPU スケジューリング(GRES/MIG/MPS)、マルチノード分散学習(PyTorch DDP/DeepSpeed/Horovod)、コンテナ統合(Singularity/Enroot+Pyxis)、設定
2026-03-01 · 18 分で読めます #slurm#hpc#gpu#distributed-training#clusterCUDA Hands-on完全ガイド:GPUコンピューティングのすべて
NVIDIA CUDAの基礎概念からGPUアーキテクチャ、C/C++カーネルプログラミング、メモリ最適化、Python連携(PyTorch、Numba、CuPy)、Multi-GPU学習、プロファイリング、トラブルシューティングまで、実践中心で網羅する総合ガイド。
2026-03-01 · 23 分で読めます #cuda#gpu#nvidia#deep-learning#machine-learning