태그: #Kubernetes
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
GPU Operator 스택 해부와 트러블슈팅
GPU Operator 의 구성요소와 파드가 GPU 를 받기까지의 경로를 해부하고, 같은 Insufficient nvidia.com/gpu 문장 뒤에 숨은 원인을 가르는 진단 순서와 용량 계획의 관점을 정리합니다. 소비자용 GPU 를 쓰는 필자의 실험 환경에서 겪은 containerd 드롭인 병합 사고를 근거로 쓰되, 데이터센터 GPU 와 대규모 프로덕션 경험이 아니라는 한계를 밝힙니다.
2026-10-06 · 19 분 읽기 #GPU Operator#Kubernetes#디바이스 플러그인#containerd#CDI멀티테넌트 GPU 스케줄링과 용량 계획
기본 스케줄러가 GPU를 다루는 방식의 한계에서 출발해 Kueue와 Volcano의 설계 차이, 토폴로지 인식 배치, GPU 공유의 격리 한계, DRA의 현재 상태를 정리합니다. 마지막으로 요청률과 지연 목표에서 GPU 수를 역산하는 방법을 필자의 실험 환경에서 잰 값을 기준점으로 보입니다.
2026-10-06 · 34 분 읽기 #Kubernetes#GPU#Kueue#Volcano#스케줄링하이브리드 GPU 쿠버네티스와 Cilium·Istio 네트워크
온프레미스 GPU 노드와 클라우드 노드를 한 클러스터 또는 여러 클러스터로 묶을 때 선택지와 네트워크 경로, 그리고 Cilium과 Istio의 역할 분담을 정리합니다. LLM 서빙의 긴 연결과 스트리밍 응답이 타임아웃, 로드밸런싱, 헬스체크에서 어떻게 깨지는지를 중심으로 다룹니다.
2026-10-06 · 41 분 읽기 #Kubernetes#하이브리드클라우드#GPU#Cilium#Istio