태그: #preemption
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
vLLM 내부 구조 (4) — 스케줄러와 선점, 처리량이 갑자기 무너지는 지점
vLLM 스케줄러가 매 스텝 무엇을 결정하는지, 대기 큐와 실행 큐가 어떻게 움직이는지, KV 캐시가 모자랄 때 일어나는 선점(preemption)이 지연과 처리량을 어떻게 무너뜨리는지 공식 문서와 V1 스케줄러 소스로 확인해 정리했습니다. recompute와 swap의 차이, fcfs와 priority 정책도 함께 다룹니다. vLLM 내부 구조 시리즈 4편.
2026-08-12 · 12 분 읽기 #vllm#scheduler#preemption#kv-cache#llm