태그: #쿠버네티스
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
#쿠버네티스 태그가 붙은 글은 7편이고, 가장 최근 글은 2026-10-07에 올라왔습니다.
함께 자주 붙은 태그: #토스 ML/AI Infra 준비 6 #Dynamo 2 #GPU 2 #KV캐시 2 #AI 인프라 1
최근 90일 동안 많이 읽힌 글:
ML·AI 인프라와 쿠버네티스 엔지니어가 알면 좋은 지식 지도: 직접 재 본 숫자와 함께
GPU 한 장에서 쿠버네티스 위의 서빙까지, ML·AI 인프라 엔지니어와 쿠버네티스 엔지니어가 알아 두면 좋은 지식을 여덟 개 층으로 정리합니다. 층마다 핵심 개념, 직접 재 본 숫자, 흔한 함정, 더 읽을 글을 붙였고 4주 학습 경로와 현장 질문도 담았습니다.
2026-10-07 · 24 분 읽기 #ML 인프라#AI 인프라#쿠버네티스#GPU#LLM 서빙분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-07 · 33 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리DCGM exporter 지표 전부 해부: 실제로 나오는 18개와 나오지 않는 것
테스트 환경의 dcgm-exporter 에서 실제로 받아 온 지표 18개를 하나씩 설명하고, 이 GPU 에서 나오지 않는 지표(프로파일링, XID, NVLink)와 그 이유를 로그로 확인합니다. 지표 값의 해석 함정도 정리합니다.
2026-10-07 · 17 분 읽기 #DCGM#dcgm-exporter#GPU 모니터링#Prometheus#GPU OperatorGPU 패스스루와 vfio-pci: VM 에 GPU 를 통째로 넘기는 원리
GPU 를 컨테이너가 아니라 VM 에 통째로 넘기는 패스스루가 어떤 원리로 동작하는지, IOMMU 그룹과 vfio-pci 가 각각 무슨 일을 하는지를 GPU 서버 한 대에서 읽은 예시 값으로 설명합니다. 같은 GPU 에서 nvidia-smi 가 실패하는 이유도 다룹니다.
2026-10-07 · 21 분 읽기 #GPU#패스스루#VFIO#IOMMU#KubeVirt쿠버네티스 CRD 와 오퍼레이터로 LLM 서빙 배포 자동화하기
LLM 서빙은 스케일의 단위가 파드 하나가 아니라 파드 묶음이어서 Deployment 만으로 표현하기 어렵고, 이를 LeaderWorkerSet, KServe, Dynamo 같은 CRD 와 오퍼레이터가 맡습니다. 조정 루프, 소유 참조와 finalizer, CRD 버전 관리, 롤아웃, Argo CD 와의 충돌을 공식 문서와 현재 스키마로 확인하고, 격리된 실습 환경에서 확인한 동작을 근거로
2026-10-07 · 45 분 읽기 #쿠버네티스#CRD#오퍼레이터#LeaderWorkerSet#KServeAI 스토리지와 KV 캐시 오프로드: 가중치 로딩 경로부터 LMCache 실측까지
대형 모델 서빙에서 콜드 스타트를 결정하는 가중치 로딩 경로와, GPU 메모리에 다 들어가지 않는 KV 캐시를 CPU 메모리와 디스크로 내리는 방법을 정리합니다. 필자가 잰 LMCache 실측(TTFT 576ms 에서 48.6ms)과 그 한계를 그대로 밝힙니다.
2026-10-07 · 35 분 읽기 #AI스토리지#모델로딩#KV캐시#LMCache#vLLMRDMA와 NCCL로 읽는 GPU 네트워크: InfiniBand, RoCE, 쿠버네티스 배치
GPU 서버 안팎의 통신 계층과 대역폭 차이를 정리하고, InfiniBand 와 RoCE v2 의 차이, GPUDirect RDMA, NCCL 의 동작과 측정법, 흔한 장애를 설명합니다. 마지막으로 쿠버네티스에서 RDMA 를 쓰는 구성 요소를 정리하고 추론에서 RDMA 가 필요한 지점을 6편과 연결합니다.
2026-10-07 · 41 분 읽기 #RDMA#InfiniBand#RoCE#NCCL#GPUDirect