LabHub

HPC 와 Slurm · Slurm 구성요소와 설정 파일 · 퀴즈

퀴즈: slurm.conf

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. `NodeName` 줄에서 `CPUs` 가 소켓×코어×스레드와 다르면?

    1. 로그에 경고만 남고 그대로 동작한다
    2. slurmctld 가 그 노드를 INVAL 상태에 넣고 작업을 보내지 않는다
    3. 실제 토폴로지에 맞춰 자동으로 보정된다
    4. 그 노드로의 작업 제출이 거부된다
  2. `SelectType=select/cons_tres` 를 쓰는 이유는?

    1. 노드 간 접근 통제가 강화되기 때문
    2. 스케줄링 판단 속도가 크게 빨라지기 때문
    3. 사용량 기반 계정 관리가 되기 때문
    4. 자원을 노드 단위가 아니라 코어·메모리·GRES 단위로 쪼개 할당할 수 있어서
  3. `SelectTypeParameters=CR_Core_Memory` 에서 메모리를 빼면?

    1. 회계 대상만 줄 뿐 배치 결과는 달라지지 않는다
    2. 메모리가 소비 자원으로 계산되지 않아 한 노드에 메모리 초과 작업이 몰려 OOM 이 난다
    3. 메모리를 요청한 작업의 제출이 곧바로 거부된다
    4. GPU 를 GRES 로 할당할 수 없게 되어 버린다
  4. `TaskPlugin=task/cgroup` 이 하는 일은?

    1. 각 작업의 실행 로그를 모아서 수집한다
    2. 요청한 자원 밖의 CPU·메모리·GPU 에 접근하지 못하도록 격리한다
    3. 작업의 대기 우선순위 점수를 계산한다
    4. 노드 상태를 컨트롤러에 주기적으로 보고한다
  5. `StateSaveLocation` 디렉터리를 잃으면?

    1. 설정만 다시 읽으면 된다
    2. 큐와 실행 중이던 작업 상태가 사라진다
    3. 노드가 DOWN 된다
    4. 인증이 실패한다
  6. `slurm.conf` 를 한 노드에만 고치면?

    1. 설정이 달라진 노드가 클러스터에서 조용히 빠지거나 예측할 수 없게 동작한다
    2. 그 노드만 새 설정으로 정상 동작한다
    3. 컨트롤러가 다른 노드에 자동 전파한다
    4. 컨트롤러가 불일치를 감지해 거부한다