标签: #hpc
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
用 Slurm 跑 GPU 集群 —— 比提交更重要的是知道为什么不跑
整理了在 GPU 集群上实务使用 Slurm 所需的一切。先建立分区、QoS、账户这套坐标系,再讲在 sbatch 脚本里申请 GPU、CPU、内存的方法,以及其间的绑定陷阱。用两段真正能跑起来的脚本,给出通过 srun 和 rendezvous 启动多节点训练的两种模式,还讲了如何用数组作业和依赖链把参数扫描和续训交给调度器去管。后半部分全是失败案例:按代码解读 PENDING 原因的方法、区分主机内存 OOM 与 GPU OOM 的
2026-08-02 · 20 分钟阅读 #mlops#slurm#hpc#gpu-cluster#distributed-training