태그: #model-serving
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 22 편
Kubernetes ML 모델 서빙: KServe와 NVIDIA Triton 완전 분석
KServe와 NVIDIA Triton 공식 문서를 기반으로 Kubernetes 환경에서의 ML 모델 서빙 아키텍처를 체계적으로 분석한다.
2026-03-01 · 31 분 읽기 #mlops#kubernetes#model-serving#kserve#tritonvLLM & Ollama 완벽 가이드: LLM 서빙 엔진의 구동, 파라미터, 환경변수 총정리
vLLM의 PagedAttention 아키텍처와 Ollama의 로컬 LLM 실행 환경을 심층 비교한다. 설치부터 서버 구동, API 호출, 주요 CLI 인자, 샘플링 파라미터, 환경변수, 양자화(AWQ/GPTQ/GGUF), 멀티 GPU 구성, Docker 배포, 성능 튜닝까지 — LLM 서빙에 필요한 모든 설정을 실전 예제와 함께 총정리한다.
2026-03-01 · 56 분 읽기 #vllm#ollama#model-serving#inference#gpu