태그: #paged-attention
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 9 편
vLLM 내부 구조 (2) — PagedAttention은 KV 캐시를 왜 페이지로 쪼갰는가
PagedAttention이 KV 캐시를 블록 단위로 쪼갠 이유를 원 논문(arXiv:2309.06180)과 vLLM 공식 설계 문서로 확인해 정리했습니다. 연속 할당이 만드는 내부·외부 단편화, 블록 테이블이 하는 일, 블록 크기를 키우고 줄일 때의 트레이드오프까지 다룹니다. vLLM 내부 구조 시리즈 2편.
2026-08-12 · 12 분 읽기 #vllm#paged-attention#kv-cache#llm#gpuvLLM을 고쳐서 빠르게 만들기 — 설정, 내부 구조, 그리고 코드를 건드릴 지점
vLLM 성능을 올리는 작업을 코드를 고치지 않고 되는 것부터 순서대로 정리합니다. 배치 관련 인자와 프리픽스 캐싱, 청크드 프리필, 양자화 선택을 먼저 다루고, 그다음 PagedAttention과 연속 배칭 스케줄러가 내부에서 무엇을 결정하는지 실제 소스를 근거로 설명합니다. 실제로 코드를 건드릴 만한 세 지점인 커스텀 로짓 프로세서, 커스텀 어텐션 백엔드, 스케줄러 정책과 그 대가도 짚습
2026-08-02 · 35 분 읽기 #vllm#llm-inference#paged-attention#benchmark#schedulerKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantizationLLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화GPU 메모리 관리 & LLM 추론 최적화: vLLM, PagedAttention, GPTQ, TensorRT-LLM까지
HBM 메모리 계층, KV 캐시 계산, PagedAttention, GPTQ/AWQ 양자화, continuous batching, vLLM vs TensorRT-LLM 비교까지 LLM 추론 최적화 완전 가이드입니다.
2026-03-17 · 25 분 읽기 #gpu-memory#llm-inference#vllm#paged-attention#gptqvLLM 프로덕션 서빙 최적화 완전 가이드: PagedAttention부터 Kubernetes 배포까지
vLLM의 핵심 아키텍처인 PagedAttention부터 Continuous Batching, Tensor Parallelism, Speculative Decoding, Prefix Caching 등 최적화 기법, 상세 설정 가이드, TGI·TensorRT-LLM과의 성능 비교, Kubernetes 배포 패턴, 모니터링과 트러블슈팅까지 프로덕션 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#vllm#paged-attention#continuous-batching#tensor-parallelismLLM 롱 컨텍스트 성능과 KV Cache 최적화 완전 가이드: MQA에서 Ring Attention까지
LLM의 롱 컨텍스트 처리를 가능하게 하는 KV Cache의 원리부터 메모리 소비 분석, MQA·GQA·PagedAttention·슬라이딩 윈도우·Ring Attention 등 최적화 기법, 모델별 컨텍스트 윈도우 비교, Needle-in-a-Haystack 벤치마크까지 실무 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#kv-cache#long-context#multi-query-attention#grouped-query-attentionvLLM PagedAttention 기반 LLM 프로덕션 서빙 최적화와 추론 엔진 비교 가이드
vLLM의 PagedAttention 알고리즘부터 프로덕션 배포, 성능 튜닝, SGLang·TensorRT-LLM과의 비교, Kubernetes 연동까지 다루는 LLM 서빙 종합 가이드.
2026-03-06 · 34 분 읽기 #llm#vllm#paged-attention#model-serving#2026-03vLLM 완벽 가이드 — PagedAttention부터 프로덕션 최적화까지
vLLM의 핵심인 PagedAttention 메커니즘부터 Continuous Batching, Tensor/Pipeline Parallelism, Prefix Caching까지 LLM 추론 최적화의 모든 것을 다룹니다.
2026-03-03 · 12 분 읽기 #llm#vllm#inference#paged-attention#model-serving