태그: #slurm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
Slurm으로 GPU 클러스터 쓰기 — 제출보다 중요한 것은 왜 안 도는지 아는 일
GPU 클러스터에서 Slurm을 실무로 쓰는 데 필요한 것만 정리했습니다. 파티션과 QoS, 계정이라는 좌표계를 먼저 세우고, sbatch 스크립트에서 GPU와 CPU, 메모리를 요구하는 방법과 그 사이의 바인딩 함정을 다룹니다. 멀티노드 학습을 srun과 랑데뷰로 띄우는 두 가지 패턴을 실제로 도는 스크립트로 제시하고, 배열 작업과 의존성 체인으로 스윕과 재개를 스케줄러에 맡기는 방법도 넣
2026-08-02 · 23 분 읽기 #mlops#slurm#hpc#gpu-cluster#distributed-training멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowSlurm 완전 정복: HPC/AI 클러스터 워크로드 매니저 실전 가이드
Slurm 워크로드 매니저를 완전 정복한다. 아키텍처(slurmctld/slurmd/slurmdbd), 핵심 개념(파티션/QoS/Fairshare), 필수 명령어(sbatch/srun/salloc), GPU 스케줄링(GRES/MIG/MPS), 다중 노드 분산 학습(PyTorch DDP/DeepSpeed/Horovod), 컨테이너 통합(Singularity/Enroot+Pyxis), 설정·모니
2026-03-01 · 17 분 읽기 #slurm#hpc#gpu#distributed-training#cluster