HPC 与 Slurm
GPU 서버가 한 대일 때는 순서를 말로 정합니다. 네 대가 되면 배치 스케줄러가 필요합니다. 이 코스는 Slurm 의 구성요소와 설정 파일을 정확히 쓰는 훈련입니다. slurm.conf 를 요구사항대로 작성하고, GPU 를 GRES 로 정의하고, sbatch 스크립트로 자원을 요청하고, 마지막에 깨진 설정에서 원인 네 개를 찾아냅니다. 실제 slurmd 는 돌리지 않고 작성한 설정과 진단 산출물을 채점합니다 — 현장에서도 장애의 대부분이 설정 파일 한 줄에서 납니다.
고급 · 레슨 14 · 实验 4
커리큘럼
为什么需要批处理调度器
- 靠口头约定分 GPU 会出什么事 reading
- 测验:批处理调度器 quiz
Slurm 组件与配置文件
- 把 slurm.conf 写准 reading
- 编写 slurm.conf lab
- 测验:slurm.conf quiz
节点、分区与 GRES 的定义
- 用 GRES 定义 GPU reading
- 把 GPU 定义成 GRES lab
- 测验:GRES quiz
作业提交与资源申请
- sbatch 脚本怎么写 reading
- 编写 sbatch 脚本 lab
- 测验:作业提交 quiz
故障诊断
- 节点掉了之后要读的顺序 reading
- 诊断一个坏掉的集群 lab
- 测验:Slurm 故障诊断 quiz