태그: #vllm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 36 편
vLLM 메트릭 — 무엇을 대시보드에 올리고 무엇으로 알람을 걸까
vLLM이 노출하는 시계열은 GPU 메트릭이 답하지 못하는 질문에 답합니다. 지금 몇 개가 실행 중이고 몇 개가 대기 중인지, KV 캐시가 얼마나 찼는지, 첫 토큰까지 얼마나 걸리는지 같은 것들입니다. 이 글은 vLLM 공식 문서와 저장소의 메트릭 로거 소스를 직접 읽고 스케줄러 상태 게이지, 캐시 계열 카운터, 지연 히스토그램의 정확한 이름과 의미를 정리하고, 카운터 이름의 접미사 차이처럼
2026-08-12 · 13 분 읽기 #gpu#kubernetes#vllm#prometheus#observabilityvLLM 내부 구조 (5) — 접두사 캐싱, 시스템 프롬프트 설계가 곧 성능이 되는 이유
vLLM의 접두사 캐싱이 언제 적중하고 언제 못 하는지를 공식 설계 문서 기준으로 정리했습니다. 블록 해시가 앞 블록에 사슬처럼 묶이는 구조, 꽉 찬 블록만 캐시되는 이유, 프롬프트 맨 앞에 넣은 타임스탬프 하나가 캐시 전체를 날리는 과정, 그리고 cachesalt까지 다룹니다. vLLM 내부 구조 시리즈 5편.
2026-08-12 · 13 분 읽기 #vllm#prefix-caching#kv-cache#prompt-engineering#llmvLLM 내부 구조 (3) — 연속 배칭이 GPU를 놀게 두지 않는 방법
정적 배칭이 왜 GPU를 놀리는지, vLLM의 이터레이션 단위 스케줄링이 그것을 어떻게 없애는지 정리했습니다. prefill과 decode의 성격 차이, V1의 통합 스케줄러와 토큰 예산, chunked prefill이 지연과 처리량에 미치는 영향을 공식 문서 기준으로 확인했습니다. vLLM 내부 구조 시리즈 3편.
2026-08-12 · 12 분 읽기 #vllm#continuous-batching#chunked-prefill#llm#inferencevLLM 내부 구조 (4) — 스케줄러와 선점, 처리량이 갑자기 무너지는 지점
vLLM 스케줄러가 매 스텝 무엇을 결정하는지, 대기 큐와 실행 큐가 어떻게 움직이는지, KV 캐시가 모자랄 때 일어나는 선점(preemption)이 지연과 처리량을 어떻게 무너뜨리는지 공식 문서와 V1 스케줄러 소스로 확인해 정리했습니다. recompute와 swap의 차이, fcfs와 priority 정책도 함께 다룹니다. vLLM 내부 구조 시리즈 4편.
2026-08-12 · 12 분 읽기 #vllm#scheduler#preemption#kv-cache#llmvLLM 내부 구조 (1) — 요청 하나가 토큰이 되어 나오기까지
vLLM에 요청 하나가 들어와 토큰이 나오기까지의 전체 경로를 따라갑니다. API 서버, 스케줄러, KV 캐시 매니저, 워커, 샘플러가 각각 무슨 일을 하는지, V1 재작성 이후 프로세스가 어떻게 나뉘는지를 공식 문서와 소스로 확인해 정리했습니다. vLLM 내부 구조 시리즈 1편.
2026-08-12 · 10 분 읽기 #vllm#llm#inference#gpu#ai-platformvLLM 내부 구조 (7) — 배포 튜닝과 흔한 함정, OOM 진단 순서
vLLM 배포를 실제로 튜닝하는 순서를 정리했습니다. gpumemoryutilization이 무엇을 정하는지, 텐서 병렬과 파이프라인 병렬을 언제 쓰는지, 양자화와 KV 캐시 자료형을 어떻게 고르는지, 그리고 OOM이 났을 때 기동 단계와 운영 단계를 나눠 진단하는 순서까지 공식 문서 기준으로 확인해 정리했습니다. vLLM 내부 구조 시리즈 마지막 편.
2026-08-12 · 17 분 읽기 #vllm#gpu#quantization#tensor-parallel#llmvLLM 내부 구조 (2) — PagedAttention은 KV 캐시를 왜 페이지로 쪼갰는가
PagedAttention이 KV 캐시를 블록 단위로 쪼갠 이유를 원 논문(arXiv:2309.06180)과 vLLM 공식 설계 문서로 확인해 정리했습니다. 연속 할당이 만드는 내부·외부 단편화, 블록 테이블이 하는 일, 블록 크기를 키우고 줄일 때의 트레이드오프까지 다룹니다. vLLM 내부 구조 시리즈 2편.
2026-08-12 · 12 분 읽기 #vllm#paged-attention#kv-cache#llm#gpuvLLM 내부 구조 (6) — 컨텍스트 윈도우, max_model_len, max_tokens 완전 정리
컨텍스트 윈도우와 maxtokens 차이가 헷갈린다면 이 글 하나로 정리됩니다. 모델의 컨텍스트 윈도우(구조적 한계), vLLM의 maxmodellen(엔진 설정), 요청당 생성 상한인 maxtokens와 maxcompletiontokens, 그리고 배치 한도인 maxnumbatchedtokens와 maxnumseqs가 각각 무엇을 제한하는지 비교표와 실제 에러 메시지로 정리했습니다. 입력과
2026-08-12 · 20 분 읽기 #vllm#context-window#max-model-len#max-tokens#llmvLLM을 고쳐서 빠르게 만들기 — 설정, 내부 구조, 그리고 코드를 건드릴 지점
vLLM 성능을 올리는 작업을 코드를 고치지 않고 되는 것부터 순서대로 정리합니다. 배치 관련 인자와 프리픽스 캐싱, 청크드 프리필, 양자화 선택을 먼저 다루고, 그다음 PagedAttention과 연속 배칭 스케줄러가 내부에서 무엇을 결정하는지 실제 소스를 근거로 설명합니다. 실제로 코드를 건드릴 만한 세 지점인 커스텀 로짓 프로세서, 커스텀 어텐션 백엔드, 스케줄러 정책과 그 대가도 짚습
2026-08-02 · 35 분 읽기 #vllm#llm-inference#paged-attention#benchmark#schedulerPD 분리는 처리량을 늘리지 않는다 — 프리필/디코드 분리가 실제로 사는 것
프리필과 디코드를 다른 GPU로 쪼개는 PD 분리는 2026년 vLLM·SGLang·TensorRT-LLM에 모두 들어온 설계지만, 어디를 봐도 "2배에서 7배"라는 숫자만 돌아다닙니다. 그런데 vLLM 공식 문서는 같은 기능을 두고 "분리 프리필은 처리량을 개선하지 않는다"고 대문자로 못 박아 두었습니다. 둘 다 맞습니다 — 그 벤더 숫자들은 전부 처리량이 아니라 goodput(SLO를 지
2026-07-16 · 30 분 읽기 #llm#ai#inference#kv-cache#vllmLLM 추론 서빙 2026 — vLLM, SGLang, TensorRT-LLM 비교
2026년의 LLM 추론 서빙을 한눈에 정리합니다. prefill과 decode의 성격 차이, continuous batching, paged KV 캐시 같은 핵심 원리부터 vLLM, SGLang, TensorRT-LLM의 강약점 비교와 선택 가이드, 실제 배포 설정까지 개발자 관점에서 다룹니다.
2026-06-26 · 27 분 읽기 #llm-serving#vllm#sglang#tensorrt-llm#inference멀티모달 LLM 서빙 — 이미지 입력이 만드는 새로운 과제
텍스트 전용 LLM 서빙과 무엇이 다른지부터, 비전 인코더 추가 단계, 가변 비주얼 토큰 수, 프리필 비용 급증, 멀티모달 KV 캐시와 배칭의 난점, 지연 분해와 처리량 최적화, 비용과 운영 함정까지 멀티모달 LLM 서빙의 실무를 정리합니다.
2026-06-26 · 30 분 읽기 #mlops#multimodal#llm-serving#vllm#kv-cacheKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantization로컬 LLM 인퍼런스 최적화 — 양자화부터 VRAM 한계 돌파까지
프라이버시와 비용, 그리고 빅테크 피로감 속에 로컬 LLM이 다시 뜨고 있습니다. VRAM 중심의 하드웨어 선택, GGUF와 AWQ 양자화, llama.cpp와 vLLM과 Ollama 비교, KV cache 메모리 산수, VRAM을 스왑으로 쓰는 역발상 해킹까지 로컬 인퍼런스 최적화의 전체 지도를 그립니다.
2026-06-12 · 29 분 읽기 #llm#inference#quantization#llama-cpp#vllmLLM 논문 큐레이션 2024-2026 - Llama · DeepSeek · Qwen · Mistral · Phi · RLHF · DPO · CoT · RAG · FlashAttention · vLLM 심층 가이드
LLM을 만들고 운영하는 엔지니어를 위한 2024-2026 필독 논문 30+편 큐레이션. 파운데이션 모델(Llama 3/4, DeepSeek-V3/R1, Qwen3, Mistral, Phi-4, Gemma 3), 학습 혁신(MoE, MLA, GQA), 포스트-트레이닝(RLHF, DPO, ORPO, KTO), 추론(CoT, ToT, GRPO), 에이전트(ReAct, SWE-Agent), 검색(
2026-05-16 · 28 분 읽기 #llm#papers#llama#deepseek#qwenLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cppAI 추론 엔진 2026 완벽 가이드 - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 심층 분석
2026년 LLM 추론은 더 이상 모델 선택의 문제가 아니라 엔진 선택의 문제가 됐다. vLLM V1, SGLang 0.4, TensorRT-LLM, TGI 3.x, llama.cpp, MLX-LM, mistral.rs, DeepSpeed-MII, Aphrodite, CTranslate2, ExLlamaV3, OpenVINO, AWS Neuron, Triton — 10개+ 엔진을 PagedA
2026-05-16 · 31 분 읽기 #llm-inference#vllm#sglang#llama-cpp#tgi로컬 LLM 시대 완전 가이드: Llama, Qwen, Mistral, vLLM, 양자화, Apple Silicon (2025)
외부 API에 모든 걸 의존하던 시절이 끝나간다. 2025년은 소비자 GPU와 Apple Silicon에서 30B–70B 모델이 "쓸 만하게" 돌아가는 시대. 모델 선택(Llama/Qwen/Mistral/Gemma/Solar), 엔진(vLLM/TGI/SGLang/llama.cpp/Ollama), 양자화(AWQ/GPTQ/EXL2/GGUF), 하드웨어, 비용·전력, 그리고 Privacy-firs
2026-04-15 · 19 분 읽기 #local-llm#llama#qwen#mistral#vllmMLOps 완전 가이드 — 모델 서빙·Feature Store·Drift·A/B 테스트·GPU 경제학 (Season 2 Ep 7, 2025)
모델을 학습하는 것과 프로덕션에서 운영하는 것은 완전히 다른 게임이다. Serving(TorchServe·Triton·vLLM·TGI), Feature Store(Feast·Tecton), Training Infra(Ray·Determined), Experiment Tracking(MLflow·W&B), Data/Concept Drift 감지, Model A/B 테스트와 Shadow Depl
2026-04-15 · 17 분 읽기 #mlops#model-serving#feature-store#drift-detection#ab-testingLLM 추론 최적화 완전 가이드 2025: vLLM, TensorRT-LLM, KV Cache, Speculative Decoding
LLM 추론 최적화의 모든 것! vLLM(PagedAttention), TensorRT-LLM(FP8/INT4), KV Cache 관리, Speculative Decoding, Continuous Batching, FlashAttention, 양자화(GPTQ/AWQ/GGUF), 모델 서빙(Triton/vLLM/TGI), GPU 메모리 최적화, 비용 분석.
2026-04-14 · 34 분 읽기 #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decoding