LabHub

HPC 와 Slurm

시스템 관리자 · 고급 · 이론 5 · 퀴즈 5 · 실습 4

GPU 서버가 한 대일 때는 순서를 말로 정합니다. 네 대가 되면 배치 스케줄러가 필요합니다. 이 코스는 Slurm 의 구성요소와 설정 파일을 정확히 쓰는 훈련입니다. slurm.conf 를 요구사항대로 작성하고, GPU 를 GRES 로 정의하고, sbatch 스크립트로 자원을 요청하고, 마지막에 깨진 설정에서 원인 네 개를 찾아냅니다. 실제 slurmd 는 돌리지 않고 작성한 설정과 진단 산출물을 채점합니다 — 현장에서도 장애의 대부분이 설정 파일 한 줄에서 납니다.

실습 시작하기

커리큘럼

배치 스케줄러가 필요한 이유

공유 자원에는 큐가 필요하다.

Slurm 구성요소와 설정 파일

slurm.conf 는 모든 노드에서 동일해야 한다.

노드·파티션·GRES 정의

GPU 는 GRES 라는 이름으로 관리된다.

작업 제출과 자원 요청

#SBATCH 지시자가 곧 자원 계약이다.

장애 진단

로그 한 줄이 원인을 다 말해 준다.

참고 문서