HPC 와 Slurm · 노드·파티션·GRES 정의 · 퀴즈
퀴즈: GRES
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
`slurm.conf` 에 `Gres=gpu:a100:8`, `gres.conf` 에 `File=/dev/nvidia[0-3]` 이면?
- 선언이 큰 쪽이 무시돼 4장만 쓰인다
- 실제 장치가 8장으로 자동 확장된다
- slurmd 가 count 불일치를 보고하고 노드가 DRAIN 된다
- gres.conf 가 무시되고 8장으로 잡힌다
`gres.conf` 의 `Cores=` 가 하는 일은?
- 그 GPU 를 쓸 수 있는 코어 수를 제한한다
- 그 GPU 와 가까운 CPU 코어를 알려 주어 같은 소켓에 배치하게 한다
- GPU 안의 연산 코어 수를 지정한다
- 그 GPU 작업의 CPU 우선순위를 정한다
`AutoDetect=nvml` 의 한계는?
- MIG 인스턴스는 전혀 탐지하지 못하고 빠뜨린다
- NVML 과 함께 빌드된 Slurm 이 필요하고, 탐지 결과가 선언과 다르면 노드가 빠진다
- 탐지 과정 때문에 slurmd 기동이 느려진다
- 여러 GPU 타입이 섞인 노드를 다루지 못한다
작업 안에서 `CUDA_VISIBLE_DEVICES` 값에 대한 설명으로 옳은 것은?
- 배정된 물리 GPU 번호가 그대로 들어온다
- 작업 스크립트 안에서는 언제나 비어 있다
- 0부터 시작하는 논리 번호이므로 코드에서 물리 번호를 하드코딩하면 안 된다
- 사용자가 직접 설정해 주어야 한다
MIG 를 사용하는 클러스터에서 주의할 점은?
- MIG 는 GRES 로 표현할 수 없다
- MIG 는 파티션으로만 관리한다
- MIG 인스턴스는 개수를 셀 수 없다
- MIG 구성이 바뀌면 gres.conf 도 함께 바뀌어야 한다
노드의 GPU 한 장이 하드웨어 오류로 사라져 노드가 DRAIN 됐습니다. 이 동작에 대한 평가는?
- 고장 난 GPU 로 작업이 도는 것보다 낫다 — 의도된 안전장치다
- 과도한 반응이므로 검사를 꺼야 한다
- 설정을 잘못 적어서 생긴 오류다
- slurmd 가 잘못 판단한 버그다