태그: #prefix-caching
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
vLLM 내부 구조 (5) — 접두사 캐싱, 시스템 프롬프트 설계가 곧 성능이 되는 이유
vLLM의 접두사 캐싱이 언제 적중하고 언제 못 하는지를 공식 설계 문서 기준으로 정리했습니다. 블록 해시가 앞 블록에 사슬처럼 묶이는 구조, 꽉 찬 블록만 캐시되는 이유, 프롬프트 맨 앞에 넣은 타임스탬프 하나가 캐시 전체를 날리는 과정, 그리고 cachesalt까지 다룹니다. vLLM 내부 구조 시리즈 5편.
2026-08-12 · 13 분 읽기 #vllm#prefix-caching#kv-cache#prompt-engineering#llm