태그: #llm-inference
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 8 편
vLLM 메트릭 — 무엇을 대시보드에 올리고 무엇으로 알람을 걸까
vLLM이 노출하는 시계열은 GPU 메트릭이 답하지 못하는 질문에 답합니다. 지금 몇 개가 실행 중이고 몇 개가 대기 중인지, KV 캐시가 얼마나 찼는지, 첫 토큰까지 얼마나 걸리는지 같은 것들입니다. 이 글은 vLLM 공식 문서와 저장소의 메트릭 로거 소스를 직접 읽고 스케줄러 상태 게이지, 캐시 계열 카운터, 지연 히스토그램의 정확한 이름과 의미를 정리하고, 카운터 이름의 접미사 차이처럼
2026-08-12 · 13 분 읽기 #gpu#kubernetes#vllm#prometheus#observabilityvLLM을 고쳐서 빠르게 만들기 — 설정, 내부 구조, 그리고 코드를 건드릴 지점
vLLM 성능을 올리는 작업을 코드를 고치지 않고 되는 것부터 순서대로 정리합니다. 배치 관련 인자와 프리픽스 캐싱, 청크드 프리필, 양자화 선택을 먼저 다루고, 그다음 PagedAttention과 연속 배칭 스케줄러가 내부에서 무엇을 결정하는지 실제 소스를 근거로 설명합니다. 실제로 코드를 건드릴 만한 세 지점인 커스텀 로짓 프로세서, 커스텀 어텐션 백엔드, 스케줄러 정책과 그 대가도 짚습
2026-08-02 · 35 분 읽기 #vllm#llm-inference#paged-attention#benchmark#schedulerllama.cpp가 브라우저로 들어왔다 — WebGPU 백엔드가 16개 기기에서 측정한 천장
UC Santa Cruz 팀이 2026년 5월에 공개한 LlamaWeb은 llama.cpp의 WebGPU 백엔드로, 8개 벤더의 기기 16대에서 브라우저 LLM 추론을 실측한 지금까지 가장 넓은 데이터셋을 남겼습니다. 결과는 양면적입니다. 기존 브라우저 프레임워크(WebLLM, Transformers.js)보다 메모리를 29~33% 덜 쓰고 디코드 처리량은 45~69% 높지만, prefill
2026-07-16 · 31 분 읽기 #webgpu#llm-inference#llama-cpp#on-device-ai#browserAI 추론 엔진 2026 완벽 가이드 - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 심층 분석
2026년 LLM 추론은 더 이상 모델 선택의 문제가 아니라 엔진 선택의 문제가 됐다. vLLM V1, SGLang 0.4, TensorRT-LLM, TGI 3.x, llama.cpp, MLX-LM, mistral.rs, DeepSpeed-MII, Aphrodite, CTranslate2, ExLlamaV3, OpenVINO, AWS Neuron, Triton — 10개+ 엔진을 PagedA
2026-05-16 · 31 분 읽기 #llm-inference#vllm#sglang#llama-cpp#tgiLLM 추론 최적화 완전 가이드 2025: vLLM, TensorRT-LLM, KV Cache, Speculative Decoding
LLM 추론 최적화의 모든 것! vLLM(PagedAttention), TensorRT-LLM(FP8/INT4), KV Cache 관리, Speculative Decoding, Continuous Batching, FlashAttention, 양자화(GPTQ/AWQ/GGUF), 모델 서빙(Triton/vLLM/TGI), GPU 메모리 최적화, 비용 분석.
2026-04-14 · 34 분 읽기 #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingNPU 완전 해부: 트랜스포머 아키텍처가 실리콘 위에서 어떻게 달리는가
NPU가 CPU/GPU와 무엇이 다른지, 트랜스포머의 모든 연산이 하드웨어에 어떻게 매핑되는지, 왜 LLM 추론은 메모리 바운드인지를 루프라인 모델과 실제 코드로 완전 해부합니다. Apple ANE부터 Qualcomm Hexagon, Groq LPU까지.
2026-03-18 · 28 분 읽기 #npu#트랜스포머#ai-hardware#양자화#KV캐시GPU 메모리 관리 & LLM 추론 최적화: vLLM, PagedAttention, GPTQ, TensorRT-LLM까지
HBM 메모리 계층, KV 캐시 계산, PagedAttention, GPTQ/AWQ 양자화, continuous batching, vLLM vs TensorRT-LLM 비교까지 LLM 추론 최적화 완전 가이드입니다.
2026-03-17 · 25 분 읽기 #gpu-memory#llm-inference#vllm#paged-attention#gptqvLLM을 넘어선 새로운 왕좌: SGLang이 LLM 인퍼런스의 판도를 바꾸는 5가지 이유
SGLang의 RadixAttention 기반 KV 캐시 관리, 29% 처리량 우위의 하이퍼 스페셜라이즈드 설계, 4000라인 Python Zero-Overhead 스케줄러, Prefill-Decode Disaggregation, Compressed FSM 기반 구조화된 생성까지 — vLLM을 넘어 차세대 LLM 인퍼런스 표준으로 부상한 SGLang의 5가지 혁신을 심층 분석한다.
2026-03-01 · 52 분 읽기 #sglang#llm-inference#vllm#radix-attention#model-serving