태그: #tensor-parallel
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
vLLM 내부 구조 (7) — 배포 튜닝과 흔한 함정, OOM 진단 순서
vLLM 배포를 실제로 튜닝하는 순서를 정리했습니다. gpumemoryutilization이 무엇을 정하는지, 텐서 병렬과 파이프라인 병렬을 언제 쓰는지, 양자화와 KV 캐시 자료형을 어떻게 고르는지, 그리고 OOM이 났을 때 기동 단계와 운영 단계를 나눠 진단하는 순서까지 공식 문서 기준으로 확인해 정리했습니다. vLLM 내부 구조 시리즈 마지막 편.
2026-08-12 · 17 분 읽기 #vllm#gpu#quantization#tensor-parallel#llm