태그: #distributed-training
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 18 편
Slurm으로 GPU 클러스터 쓰기 — 제출보다 중요한 것은 왜 안 도는지 아는 일
GPU 클러스터에서 Slurm을 실무로 쓰는 데 필요한 것만 정리했습니다. 파티션과 QoS, 계정이라는 좌표계를 먼저 세우고, sbatch 스크립트에서 GPU와 CPU, 메모리를 요구하는 방법과 그 사이의 바인딩 함정을 다룹니다. 멀티노드 학습을 srun과 랑데뷰로 띄우는 두 가지 패턴을 실제로 도는 스크립트로 제시하고, 배열 작업과 의존성 체인으로 스윕과 재개를 스케줄러에 맡기는 방법도 넣
2026-08-02 · 23 분 읽기 #mlops#slurm#hpc#gpu-cluster#distributed-training멀티 GPU 학습의 네 가지 병렬화 — 무엇을 쪼개고 무엇을 통신하는가
데이터 병렬, 텐서 병렬, 파이프라인 병렬, 컨텍스트 병렬이 각각 무엇을 쪼개고 그 대가로 무엇을 통신하는지를 숫자로 정리했습니다. 먼저 Adam 혼합정밀 학습의 파라미터당 16바이트 장부를 세우고, ZeRO 1~3단계가 그 장부의 어느 항을 GPU 수로 나누는지 계산합니다. 이어서 활성화 메모리 공식으로 체크포인팅이 왜 100GB를 1GB로 만드는지 확인하고, 각 병렬화의 통신량을 스텝당
2026-08-02 · 23 분 읽기 #mlops#distributed-training#multi-gpu#fsdp#deepspeedPyTorch 2.13의 torchcomms — c10d를 대체하러 온 새 분산 통신 백엔드
2026년 7월 8일 릴리스된 PyTorch 2.13의 하이라이트 가운데 가장 구조적인 변화는 torchcomms — PyTorch Distributed의 새 통신 백엔드가 코어의 CI와 DeviceMesh 경로에 통합되기 시작한 것입니다. torchcomms는 2025년 10월 Meta가 발표한 실험적 통신 API로, 전역 상태 기반 c10d ProcessGroup의 기술 부채(NCCL 중
2026-07-17 · 19 분 읽기 #pytorch#distributed-training#nccl#deep-learningKubernetes v1.36의 Workload/PodGroup API — 갱 스케줄링이 kube-scheduler 안으로 들어오는 중
AI 학습·배치 워크로드의 갱 스케줄링은 지금까지 Volcano나 Kueue 같은 외부 스케줄러의 몫이었지만, Kubernetes가 이 기능을 코어로 가져오기 시작했습니다. v1.35가 Workload API와 첫 갱 스케줄링 구현을 알파로 내놨고, 2026년 4월 22일 나온 v1.36은 구조를 갈아엎어 Workload를 정적 템플릿으로, 새 PodGroup을 런타임 객체로 분리하고 그룹
2026-07-16 · 34 분 읽기 #kubernetes#scheduling#gang-scheduling#distributed-training#dra멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowAI 인터커넥트 — NVLink, NVSwitch, UALink, 그리고 스케일업의 기술
대규모 AI 학습과 추론의 진짜 병목은 연산이 아니라 통신입니다. NVLink와 NVSwitch가 만드는 스케일업 도메인, GB200 NVL72 같은 랙 스케일 시스템, 그리고 UALink와 Ultra Ethernet 같은 개방형 대안까지, AI 인터커넥트의 원리와 실무를 정리합니다.
2026-06-16 · 54 분 읽기 #gpu-cuda#nvlink#nvswitch#ualink#interconnect분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#rayTorch-Titan 완전 가이드: PyTorch 대규모 분산 학습의 모든 것
PyTorch Titan(torchtitan)으로 대규모 LLM 분산 학습을 마스터하는 완전 가이드. FSDP2, 파이프라인 병렬화, Tensor 병렬화, 4D 병렬화, 플래시 어텐션, 혼합 정밀도까지 실전 예제와 함께 배웁니다.
2026-03-17 · 31 분 읽기 #torch-titan#distributed-training#pytorch#fsdp#deep-learning대규모 모델 학습 완전 가이드: 100B+ 파라미터 LLM 사전학습 전략
수백억 파라미터 LLM을 실제로 학습시키는 전략과 기법 완전 가이드. 스케일링 법칙(Chinchilla), Megatron-LM, 3D 병렬화, 체크포인팅 전략, 학습 안정성, 데이터 혼합 전략까지 실전으로 배웁니다.
2026-03-17 · 29 분 읽기 #large-scale-training#llm#megatron-lm#distributed-training#scaling-laws연합 학습(Federated Learning) 완전 가이드: 프라이버시 보존 분산 AI
연합 학습(Federated Learning)을 완전히 마스터하는 가이드. 데이터 프라이버시를 보존하면서 분산 학습하는 방법, FedAvg, FedProx, 차등 프라이버시, Flower 프레임워크 활용까지 실전 코드로 배웁니다.
2026-03-17 · 39 분 읽기 #federated-learning#privacy#distributed-training#differential-privacy#ai분산 시스템 완전 정복: CAP theorem부터 분산 ML 학습, Kafka까지
CAP theorem, Raft 합의 알고리즘, Kafka 메시지 큐부터 Ring-AllReduce 분산 ML 학습과 NCCL까지 AI 엔지니어를 위한 분산 시스템 완전 가이드입니다.
2026-03-17 · 24 분 읽기 #distributed-systems#kafka#raft#pytorchdistributed#ncclPyTorch 내부 구조 & 고급 최적화: autograd, torch.compile, FSDP, Triton까지
PyTorch autograd 엔진, torch.compile() TorchInductor 최적화, FSDP 분산 학습, gradient checkpointing, 커스텀 CUDA 연산까지 PyTorch 완전 정복 가이드입니다.
2026-03-17 · 15 분 읽기 #pytorch#torch-compile#fsdp#triton#혼합정밀도DeepSpeed 완전 가이드: ZeRO 최적화와 대규모 모델 학습
Microsoft DeepSpeed를 완전히 마스터하는 가이드. ZeRO-1/2/3 최적화, Offload, 파이프라인 병렬화, 혼합 정밀도, MoE, DeepSpeed Inference까지 실전 설정과 코드로 배웁니다.
2026-03-17 · 23 분 읽기 #deepspeed#zero-optimization#distributed-training#llm#pytorch딥러닝 학습 방법론 완전 정복: 최적화부터 분산 학습까지
딥러닝 모델을 효과적으로 학습시키는 모든 기법을 다루는 완전 가이드. 경사 하강법, 옵티마이저, 학습률 스케줄링, 정규화, 배치 정규화, 전이학습, 파인튜닝, 분산 학습까지 실전 코드와 함께 배웁니다.
2026-03-17 · 42 분 읽기 #deep-learning#training#optimization#regularization#distributed-trainingRing Attention 논문 분석: 분산 환경에서 무한 컨텍스트 윈도우 트레이닝 구현
Ring Attention 논문을 분석하고 분산 환경에서 컨텍스트 길이 제한을 극복하는 방법을 탐구합니다. Blockwise Parallel Transformer와의 연결, 구현 세부사항, 성능 벤치마크, 그리고 프로덕션 적용 시 고려사항까지 다룹니다.
2026-03-08 · 55 분 읽기 #ai-papers#ring-attention#distributed-training#long-context#transformerMulti-GPU 분산 학습 완전 가이드: DDP, FSDP, DeepSpeed
PyTorch 공식 문서 기반으로 Multi-GPU 분산 학습의 핵심인 DDP, FSDP, DeepSpeed ZeRO를 체계적으로 분석하고 실전 설정법을 정리한다.
2026-03-01 · 31 분 읽기 #gpu#cuda#distributed-training#deep-learning#pytorchSlurm 완전 정복: HPC/AI 클러스터 워크로드 매니저 실전 가이드
Slurm 워크로드 매니저를 완전 정복한다. 아키텍처(slurmctld/slurmd/slurmdbd), 핵심 개념(파티션/QoS/Fairshare), 필수 명령어(sbatch/srun/salloc), GPU 스케줄링(GRES/MIG/MPS), 다중 노드 분산 학습(PyTorch DDP/DeepSpeed/Horovod), 컨테이너 통합(Singularity/Enroot+Pyxis), 설정·모니
2026-03-01 · 17 분 읽기 #slurm#hpc#gpu#distributed-training#clusterKubernetes AI 학습 파이프라인: Volcano, Training Operator, Kueue 분석
Volcano, Kubeflow Training Operator, Kueue 공식 문서를 기반으로 Kubernetes 위에서 분산 AI 학습 파이프라인을 구축하는 방법을 분석한다.
2026-03-01 · 31 분 읽기 #kubernetes#ai#distributed-training#volcano#kubeflow