LabHub
学习 学习路径 课程

HPC 与 Slurm

测验:GRES

在 LabHub 中继续学习

slurm.conf 中是 Gres=gpu:a100:8,而 gres.conf 中是 File=/dev/nvidia[0-3],会怎样?

gres.conf 中的 Cores= 有什么作用?

AutoDetect=nvml 有什么局限?

关于作业中的 CUDA_VISIBLE_DEVICES,哪项正确?

使用 MIG 的集群需要注意什么?

节点上一块 GPU 因硬件故障消失,节点进入 DRAIN。如何评价该行为?