태그: #PagedAttention
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
LLM 추론의 기본과 vLLM 내부: KV 캐시, PagedAttention, 스케줄러
decode 가 메모리 대역폭 한계인 이유를 산술 강도로 설명하고, KV 캐시 크기 식과 vLLM v0.30.0 의 블록 관리, 접두사 캐시, 스케줄러, 선점, 운영 파라미터를 소스와 문서로 확인해 정리합니다. 8GB급 노트북 GPU 에서 잰 실측과 그 한계도 있는 그대로 적습니다.
2026-10-06 · 28 분 읽기 #LLM 추론#vLLM#KV 캐시#PagedAttention#스케줄링