태그: #kv-cache
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 17 편
vLLM 내부 구조 (5) — 접두사 캐싱, 시스템 프롬프트 설계가 곧 성능이 되는 이유
vLLM의 접두사 캐싱이 언제 적중하고 언제 못 하는지를 공식 설계 문서 기준으로 정리했습니다. 블록 해시가 앞 블록에 사슬처럼 묶이는 구조, 꽉 찬 블록만 캐시되는 이유, 프롬프트 맨 앞에 넣은 타임스탬프 하나가 캐시 전체를 날리는 과정, 그리고 cachesalt까지 다룹니다. vLLM 내부 구조 시리즈 5편.
2026-08-12 · 13 분 읽기 #vllm#prefix-caching#kv-cache#prompt-engineering#llmvLLM 내부 구조 (4) — 스케줄러와 선점, 처리량이 갑자기 무너지는 지점
vLLM 스케줄러가 매 스텝 무엇을 결정하는지, 대기 큐와 실행 큐가 어떻게 움직이는지, KV 캐시가 모자랄 때 일어나는 선점(preemption)이 지연과 처리량을 어떻게 무너뜨리는지 공식 문서와 V1 스케줄러 소스로 확인해 정리했습니다. recompute와 swap의 차이, fcfs와 priority 정책도 함께 다룹니다. vLLM 내부 구조 시리즈 4편.
2026-08-12 · 12 분 읽기 #vllm#scheduler#preemption#kv-cache#llmvLLM 내부 구조 (2) — PagedAttention은 KV 캐시를 왜 페이지로 쪼갰는가
PagedAttention이 KV 캐시를 블록 단위로 쪼갠 이유를 원 논문(arXiv:2309.06180)과 vLLM 공식 설계 문서로 확인해 정리했습니다. 연속 할당이 만드는 내부·외부 단편화, 블록 테이블이 하는 일, 블록 크기를 키우고 줄일 때의 트레이드오프까지 다룹니다. vLLM 내부 구조 시리즈 2편.
2026-08-12 · 12 분 읽기 #vllm#paged-attention#kv-cache#llm#gpu어텐션 변형 — MHA에서 MLA까지, KV 캐시는 어떻게 줄어드는가
MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#attention#gqa#mlaLLM 추론 VRAM 계산법 — 가중치보다 KV 캐시가 먼저 터집니다
"이 모델이 우리 GPU에 올라갑니까"라는 질문에 곱셈 몇 번으로 답하는 방법을 정리했습니다. 가중치 메모리는 파라미터 수 곱하기 바이트로 끝나지만, 실제로 배포를 막는 것은 시퀀스 길이와 배치에 비례해서 자라는 KV 캐시입니다. KV 캐시 공식과 GQA가 이를 몇 분의 일로 줄이는 원리, 프리필 활성화와 프레임워크 오버헤드의 크기, PagedAttention이 없앤 단편화 손실, 그리고 4
2026-07-26 · 21 분 읽기 #llm#inference#vram#kv-cache#quantization로컬에서 LLM 돌리려면 VRAM이 얼마나 필요한가 — 표 말고 공식으로 계산하기
"8B 모델에 몇 GB 필요한가요"의 정답은 표가 아니라 두 개의 공식입니다. 가중치는 파라미터 수 곱하기 bpw 나누기 8이고, KV 캐시는 2 곱하기 레이어 수 곱하기 KV 헤드 수 곱하기 headdim 곱하기 바이트 수 곱하기 토큰 수입니다. 이 글은 두 공식을 llama.cpp 소스와 공식 표에 직접 대조해 검증합니다 — ggml 블록 구조체에서 유도한 Q80의 8.5 bpw는 lla
2026-07-17 · 43 분 읽기 #llm#quantization#kv-cache#local-llm#gpuPD 분리는 처리량을 늘리지 않는다 — 프리필/디코드 분리가 실제로 사는 것
프리필과 디코드를 다른 GPU로 쪼개는 PD 분리는 2026년 vLLM·SGLang·TensorRT-LLM에 모두 들어온 설계지만, 어디를 봐도 "2배에서 7배"라는 숫자만 돌아다닙니다. 그런데 vLLM 공식 문서는 같은 기능을 두고 "분리 프리필은 처리량을 개선하지 않는다"고 대문자로 못 박아 두었습니다. 둘 다 맞습니다 — 그 벤더 숫자들은 전부 처리량이 아니라 goodput(SLO를 지
2026-07-16 · 30 분 읽기 #llm#ai#inference#kv-cache#vllmKV 캐시를 4비트로 — SAW-INT4와 시스템을 아는 INT4 양자화
긴 컨텍스트 LLM 서빙에서 진짜 메모리 병목은 가중치가 아니라 KV 캐시입니다. 이를 INT4로 그냥 줄이면 정확도가 무너지는데, 2026년 4월 프리프린트 SAW-INT4는 토큰 단위 INT4 양자화에 블록 대각 아다마르 회전을 더해 순진한 INT4가 잃은 정확도를 거의 되찾는다고 보고합니다. 이 논문의 진짜 각도는 정확도만이 아니라 처리량입니다 — 페이지드 KV 캐시 레이아웃에 바로 통
2026-07-11 · 13 분 읽기 #ai#llm#quantization#inference#kv-cacheTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cache어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqa멀티모달 LLM 서빙 — 이미지 입력이 만드는 새로운 과제
텍스트 전용 LLM 서빙과 무엇이 다른지부터, 비전 인코더 추가 단계, 가변 비주얼 토큰 수, 프리필 비용 급증, 멀티모달 KV 캐시와 배칭의 난점, 지연 분해와 처리량 최적화, 비용과 운영 함정까지 멀티모달 LLM 서빙의 실무를 정리합니다.
2026-06-26 · 30 분 읽기 #mlops#multimodal#llm-serving#vllm#kv-cacheKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantizationLLM 추론 최적화 완전 가이드 2025: vLLM, TensorRT-LLM, KV Cache, Speculative Decoding
LLM 추론 최적화의 모든 것! vLLM(PagedAttention), TensorRT-LLM(FP8/INT4), KV Cache 관리, Speculative Decoding, Continuous Batching, FlashAttention, 양자화(GPTQ/AWQ/GGUF), 모델 서빙(Triton/vLLM/TGI), GPU 메모리 최적화, 비용 분석.
2026-04-14 · 34 분 읽기 #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingLLM 추론 최적화 완전 가이드: KV Cache, Speculative Decoding, Continuous Batching
LLM 추론을 극한까지 최적화하는 완전 가이드. KV Cache, Speculative Decoding, Continuous Batching, PagedAttention, FlashInfer, 멀티GPU 추론, 그리고 DeepSeek MLA까지 심층 분석합니다.
2026-03-17 · 41 분 읽기 #llm#inference#optimization#kv-cache#speculative-decodingLLM 추론 최적화 완벽 가이드: vLLM, TensorRT-LLM, Speculative Decoding
LLM 추론 성능을 극대화하는 핵심 기술인 vLLM, TensorRT-LLM, Speculative Decoding, KV Cache 최적화를 실전 코드와 벤치마크로 비교 분석합니다.
2026-03-14 · 31 분 읽기 #llm#inference-optimization#vllm#tensorrt-llm#speculative-decodingKV Cache 최적화 심층 분석: GQA·MLA·MHA 어텐션 메커니즘과 메모리 효율화 전략
Transformer Self-Attention의 KV Cache 기본 원리부터 MHA, MQA, GQA(Llama 2/3), MLA(DeepSeek-V2/V3) 메커니즘의 메모리 분석과 비교, KV Cache 압축 기법(양자화, 퇴거 정책, 슬라이딩 윈도우), PagedAttention(vLLM) 구현, PyTorch 코드 예제, OOM 장애 사례와 최적화 체크리스트를 다룹니다.
2026-03-11 · 24 분 읽기 #ai-papers#kv-cache#attention-mechanism#gqa#mlaLLM 롱 컨텍스트 성능과 KV Cache 최적화 완전 가이드: MQA에서 Ring Attention까지
LLM의 롱 컨텍스트 처리를 가능하게 하는 KV Cache의 원리부터 메모리 소비 분석, MQA·GQA·PagedAttention·슬라이딩 윈도우·Ring Attention 등 최적화 기법, 모델별 컨텍스트 윈도우 비교, Needle-in-a-Haystack 벤치마크까지 실무 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#kv-cache#long-context#multi-query-attention#grouped-query-attention