태그: #dra
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
Kubernetes v1.36의 Workload/PodGroup API — 갱 스케줄링이 kube-scheduler 안으로 들어오는 중
AI 학습·배치 워크로드의 갱 스케줄링은 지금까지 Volcano나 Kueue 같은 외부 스케줄러의 몫이었지만, Kubernetes가 이 기능을 코어로 가져오기 시작했습니다. v1.35가 Workload API와 첫 갱 스케줄링 구현을 알파로 내놨고, 2026년 4월 22일 나온 v1.36은 구조를 갈아엎어 Workload를 정적 템플릿으로, 새 PodGroup을 런타임 객체로 분리하고 그룹
2026-07-16 · 34 분 읽기 #kubernetes#scheduling#gang-scheduling#distributed-training#draKubernetes DRA(Dynamic Resource Allocation)로 GPU 워크로드 스케줄링 최적화 가이드
Kubernetes DRA의 DeviceClass, ResourceClaim 기반 GPU 스케줄링 아키텍처와 MIG 파티셔닝, 멀티 클라우드 배포, 운영 트러블슈팅까지 다루는 실전 가이드.
2026-03-06 · 32 분 읽기 #kubernetes#dra#gpu#dynamic-resource-allocation#scheduling