LabHub

HPC 와 Slurm · 노드·파티션·GRES 정의 · 퀴즈

퀴즈: GRES

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. `slurm.conf` 에 `Gres=gpu:a100:8`, `gres.conf` 에 `File=/dev/nvidia[0-3]` 이면?

    1. 선언이 큰 쪽이 무시돼 4장만 쓰인다
    2. 실제 장치가 8장으로 자동 확장된다
    3. slurmd 가 count 불일치를 보고하고 노드가 DRAIN 된다
    4. gres.conf 가 무시되고 8장으로 잡힌다
  2. `gres.conf` 의 `Cores=` 가 하는 일은?

    1. 그 GPU 를 쓸 수 있는 코어 수를 제한한다
    2. 그 GPU 와 가까운 CPU 코어를 알려 주어 같은 소켓에 배치하게 한다
    3. GPU 안의 연산 코어 수를 지정한다
    4. 그 GPU 작업의 CPU 우선순위를 정한다
  3. `AutoDetect=nvml` 의 한계는?

    1. MIG 인스턴스는 전혀 탐지하지 못하고 빠뜨린다
    2. NVML 과 함께 빌드된 Slurm 이 필요하고, 탐지 결과가 선언과 다르면 노드가 빠진다
    3. 탐지 과정 때문에 slurmd 기동이 느려진다
    4. 여러 GPU 타입이 섞인 노드를 다루지 못한다
  4. 작업 안에서 `CUDA_VISIBLE_DEVICES` 값에 대한 설명으로 옳은 것은?

    1. 배정된 물리 GPU 번호가 그대로 들어온다
    2. 작업 스크립트 안에서는 언제나 비어 있다
    3. 0부터 시작하는 논리 번호이므로 코드에서 물리 번호를 하드코딩하면 안 된다
    4. 사용자가 직접 설정해 주어야 한다
  5. MIG 를 사용하는 클러스터에서 주의할 점은?

    1. MIG 는 GRES 로 표현할 수 없다
    2. MIG 는 파티션으로만 관리한다
    3. MIG 인스턴스는 개수를 셀 수 없다
    4. MIG 구성이 바뀌면 gres.conf 도 함께 바뀌어야 한다
  6. 노드의 GPU 한 장이 하드웨어 오류로 사라져 노드가 DRAIN 됐습니다. 이 동작에 대한 평가는?

    1. 고장 난 GPU 로 작업이 도는 것보다 낫다 — 의도된 안전장치다
    2. 과도한 반응이므로 검사를 꺼야 한다
    3. 설정을 잘못 적어서 생긴 오류다
    4. slurmd 가 잘못 판단한 버그다