태그: #병렬화
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
분산 추론과 NVIDIA Dynamo: 병렬화, prefill/decode 분리, KV 캐시 이동
모델이 GPU 한 장에 들어가지 않을 때 쓰는 네 가지 병렬화와 통신 특성을 정리하고, prefill/decode 분리가 왜 필요하며 KV 캐시 이동이라는 대가를 어떻게 치르는지 설명합니다. 이어서 2026년 10월 기준 NVIDIA Dynamo v1.5.0 의 구조와 쿠버네티스 배포 방식을 llm-d, vLLM, SGLang 과 비교합니다.
2026-10-06 · 32 분 읽기 #LLM서빙#분산추론#Dynamo#병렬화#prefill-decode분리