LabHub

HPC 와 Slurm · 장애 진단 · 퀴즈

퀴즈: Slurm 장애 진단

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. `Munge decode failed: Expired credential` 의 원인과 대응은?

    1. 노드 간 시계 불일치 — NTP 동기화를 확인한다
    2. 키 불일치 — 키 파일을 다시 배포한다
    3. 권한 문제 — munge.key 권한을 고친다
    4. 네트워크 문제 — 방화벽을 연다
  2. 노드 상태 `inval` 이 뜻하는 것은?

    1. 설정된 자원 정보가 노드가 보고하는 실제와 맞지 않는다
    2. 노드가 응답하지 않는 상태다
    3. 관리자가 수동으로 뺀 상태다
    4. 하드웨어 오류가 보고된 상태다
  3. 작업이 `squeue` 에서 `PartitionTimeLimit` 사유로 대기 중입니다. 기다리면 실행될까요?

    1. 영원히 실행되지 않으므로 요청 시간을 고쳐 다시 제출해야 한다
    2. 요청한 자원이 비면 그때 실행된다
    3. 대기 우선순위가 오르면 실행된다
    4. 다음 스케줄링 주기가 오면 실행된다
  4. `sinfo -R` 이 유용한 이유는?

    1. 노드별 자원 상세를 한눈에 보여 주기 때문
    2. 현재 작업 큐 전체를 함께 보여 주기 때문
    3. 파티션 설정 전체를 함께 보여 주기 때문
    4. DRAIN/DOWN 된 노드와 그 사유 문자열만 골라 보여 주기 때문
  5. 설정 파일을 고친 뒤 반드시 해야 할 일은?

    1. 컨트롤러의 slurmctld 만 재기동한다
    2. 모든 계산 노드를 하나씩 재부팅한다
    3. 모든 노드에 같은 파일을 배포하고 scontrol reconfigure 를 실행한다
    4. 실행 중이던 작업을 전부 취소해 둔다
  6. 원인을 고친 뒤 DRAIN 노드를 복귀시키는 명령은?

    1. scontrol reconfigure
    2. scontrol update NodeName=... State=RESUME
    3. sinfo -R
    4. systemctl restart slurmd