测验:GRES
若 slurm.conf 中是 Gres=gpu:a100:8,而 gres.conf 中是 File=/dev/nvidia[0-3],会怎样?
- 较大的声明被忽略,只使用四块
- 实际设备自动扩展为八块
- slurmd 报告 count 不一致,节点进入 DRAIN
- 忽略 gres.conf,按八块处理
gres.conf 中的 Cores= 有什么作用?
- 限制可使用该 GPU 的核心数
- 指出靠近该 GPU 的 CPU 核心,以便安排在同一插槽
- 指定 GPU 内部计算核心数
- 决定 GPU 作业的 CPU 优先级
AutoDetect=nvml 有什么局限?
- 完全无法检测 MIG 实例
- 需要 Slurm 构建时支持 NVML,且检测结果与声明不同时节点会被排除
- 检测会让 slurmd 启动缓慢
- 无法处理混合多种 GPU 类型的节点
关于作业中的 CUDA_VISIBLE_DEVICES,哪项正确?
- 其中直接写入分配到的物理 GPU 编号
- 在作业脚本中始终为空
- 它是从 0 开始的逻辑编号,代码不应硬编码物理编号
- 必须由用户自行设置
使用 MIG 的集群需要注意什么?
- MIG 无法表示为 GRES
- MIG 只能通过分区管理
- 无法统计 MIG 实例数量
- MIG 配置变化时,gres.conf 也必须同步变化
节点上一块 GPU 因硬件故障消失,节点进入 DRAIN。如何评价该行为?
- 这比让作业运行在故障 GPU 上好,是有意设计的安全机制
- 反应过度,应关闭检查
- 这是配置错误
- 这是 slurmd 的误判缺陷