태그: #모델로딩
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
← 전체 글
대형 모델 서빙에서 콜드 스타트를 결정하는 가중치 로딩 경로와, GPU 메모리에 다 들어가지 않는 KV 캐시를 CPU 메모리와 디스크로 내리는 방법을 정리합니다. 필자가 잰 LMCache 실측(TTFT 576ms 에서 48.6ms)과 그 한계를 그대로 밝힙니다.
2026-10-06 · 35 분 읽기 #AI스토리지#모델로딩#KV캐시#LMCache#vLLM