태그: #model-serving
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 22 편
MLOps 플랫폼 2026 완전판 - MLflow · Kubeflow · W&B · Vertex AI · SageMaker · Databricks · BentoML · Ray · Modal · Hugging Face 심층 가이드
2026년 5월 기준 MLOps 30여 개 플랫폼을 한 번에 비교한다. MLflow 3, Kubeflow 1.10, Weights & Biases, Comet, Neptune.ai, ClearML, Vertex AI, SageMaker, Azure ML, Databricks ML + Mosaic AI, Hugging Face Inference Endpoints, Determined, Anys
2026-05-16 · 26 분 읽기 #mlops#mlflow#kubeflow#weights-and-biases#vertex-aiLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cppMLOps 완전 가이드 — 모델 서빙·Feature Store·Drift·A/B 테스트·GPU 경제학 (Season 2 Ep 7, 2025)
모델을 학습하는 것과 프로덕션에서 운영하는 것은 완전히 다른 게임이다. Serving(TorchServe·Triton·vLLM·TGI), Feature Store(Feast·Tecton), Training Infra(Ray·Determined), Experiment Tracking(MLflow·W&B), Data/Concept Drift 감지, Model A/B 테스트와 Shadow Depl
2026-04-15 · 17 분 읽기 #mlops#model-serving#feature-store#drift-detection#ab-testingLLM 추론 최적화 완전 가이드 2025: vLLM, TensorRT-LLM, KV Cache, Speculative Decoding
LLM 추론 최적화의 모든 것! vLLM(PagedAttention), TensorRT-LLM(FP8/INT4), KV Cache 관리, Speculative Decoding, Continuous Batching, FlashAttention, 양자화(GPTQ/AWQ/GGUF), 모델 서빙(Triton/vLLM/TGI), GPU 메모리 최적화, 비용 분석.
2026-04-14 · 34 분 읽기 #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingMLOps & AI 모델 배포 완전 가이드 — 학습부터 서빙, 모니터링까지
AI 모델을 학습하고 배포하고 운영하는 전 과정. MLflow, Kubeflow, 모델 서빙, A/B 테스트, 드리프트 감지까지 MLOps의 모든 것.
2026-04-13 · 25 분 읽기 #mlops#ai#deployment#model-serving#monitoringFeature Store & MLOps 파이프라인 완전 가이드 2025: Feast, Feature Engineering, 모델 서빙
Feature Store와 MLOps의 모든 것! Feature Store 아키텍처(Feast/Tecton/Hopsworks), Feature Engineering 패턴, MLOps 파이프라인(학습→검증→배포→모니터링), 모델 서빙(BentoML/Seldon/TFServing), 모델 레지스트리(MLflow), 드리프트 감지, A/B 테스트.
2026-04-13 · 27 분 읽기 #feature-store#mlops#feast#feature-engineering#model-servingAI 모델 서빙과 추론 최적화 완전 가이드: vLLM, TensorRT, Triton, Ollama
AI 모델을 프로덕션에서 효율적으로 서빙하는 완전 가이드. vLLM, TensorRT, NVIDIA Triton Inference Server, Ollama, 양자화(INT8/INT4), 배치 처리, 지연 최적화까지 실전 예제로 마스터합니다.
2026-03-17 · 29 분 읽기 #mlops#model-serving#vllm#tensorrt#tritonAI 모델 배포 & 서빙 완전 가이드: Triton, vLLM, BentoML, Kubernetes까지
Docker GPU 컨테이너, Kubernetes HPA, NVIDIA Triton, vLLM LLM 서빙, BentoML, Ray Serve까지 AI 모델 프로덕션 배포 완전 가이드입니다.
2026-03-17 · 18 분 읽기 #model-serving#triton#vllm#bentoml#kubernetesLLMOps 플랫폼 구축 가이드: 모델 배포, 모니터링, A/B 테스트 실전 아키텍처
LLMOps 플랫폼의 설계와 구현을 다룹니다. vLLM/TGI 기반 모델 서빙, 토큰 사용량/레이턴시/품질 모니터링, 프롬프트 버전 관리, A/B 테스트 프레임워크, 가드레일 통합까지 프로덕션 LLM 운영의 전체 라이프사이클을 코드와 함께 구축합니다.
2026-03-13 · 23 분 읽기 #ai-platform#llmops#model-serving#monitoring#ab-testingLLM 추론 서빙 프레임워크 비교: TensorRT-LLM vs vLLM vs SGLang 프로덕션 배포 전략
LLM 추론 서빙 3대 프레임워크를 비교합니다. TensorRT-LLM의 하드웨어 최적화, vLLM의 PagedAttention과 프로덕션 스택, SGLang의 RadixAttention과 구조화 생성까지 벤치마크 데이터와 배포 코드로 최적의 선택을 안내합니다.
2026-03-12 · 31 분 읽기 #llm#inference#tensorrt-llm#vllm#sglangKServe 모델 서빙 완벽 가이드: InferenceService·Canary 배포·Transformer·InferenceGraph 프로덕션 운영
KServe를 활용한 Kubernetes 기반 모델 서빙을 다룹니다. InferenceService CRD로 모델 배포, Canary 전략으로 안전한 롤아웃, Transformer로 전후처리 파이프라인, InferenceGraph로 DAG 기반 복합 추론까지 프로덕션 운영 전략을 코드와 함께 구현합니다.
2026-03-12 · 25 분 읽기 #ai-platform#kserve#model-serving#kubernetes#inference-graphRay Serve 모델 서빙 플랫폼 구축 가이드 — 오토스케일링, 멀티모델, 프로덕션 배포
Ray Serve의 아키텍처, LLM 모델 서빙 배포, 오토스케일링, 멀티모델 패턴, KubeRay 운영을 실전 코드와 함께 총정리합니다.
2026-03-09 · 26 분 읽기 #ai-platform#ray-serve#model-serving#kuberay#mlopsNVIDIA Triton Inference Server 프로덕션 가이드: GPU 모델 서빙 최적화 전략
NVIDIA Triton Inference Server를 활용한 GPU 모델 서빙 최적화 가이드. Dynamic Batching, Model Ensemble, TensorRT 통합, 멀티 모델 서빙, Kubernetes 배포, 성능 프로파일링과 프로덕션 트러블슈팅까지 다룹니다.
2026-03-08 · 44 분 읽기 #ai-platform#triton#inference-server#gpu#model-servingvLLM 프로덕션 서빙 최적화 완전 가이드: PagedAttention부터 Kubernetes 배포까지
vLLM의 핵심 아키텍처인 PagedAttention부터 Continuous Batching, Tensor Parallelism, Speculative Decoding, Prefix Caching 등 최적화 기법, 상세 설정 가이드, TGI·TensorRT-LLM과의 성능 비교, Kubernetes 배포 패턴, 모니터링과 트러블슈팅까지 프로덕션 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#vllm#paged-attention#continuous-batching#tensor-parallelismvLLM PagedAttention 기반 LLM 프로덕션 서빙 최적화와 추론 엔진 비교 가이드
vLLM의 PagedAttention 알고리즘부터 프로덕션 배포, 성능 튜닝, SGLang·TensorRT-LLM과의 비교, Kubernetes 연동까지 다루는 LLM 서빙 종합 가이드.
2026-03-06 · 34 분 읽기 #llm#vllm#paged-attention#model-serving#2026-03vLLM 완벽 가이드 — PagedAttention부터 프로덕션 최적화까지
vLLM의 핵심인 PagedAttention 메커니즘부터 Continuous Batching, Tensor/Pipeline Parallelism, Prefix Caching까지 LLM 추론 최적화의 모든 것을 다룹니다.
2026-03-03 · 12 분 읽기 #llm#vllm#inference#paged-attention#model-servingBentoML로 ML 모델 서빙 파이프라인 구축하기: 패키징부터 Kubernetes 배포까지
BentoML을 활용한 ML 모델 서빙을 실습합니다. 모델 패키징, API 구현, 멀티모델 파이프라인, Docker 빌드, Kubernetes 배포까지 핸즈온으로 다룹니다.
2026-03-03 · 7 분 읽기 #ai-platform#bentoml#model-serving#mlops#kubernetesRay Serve로 구현하는 확장 가능한 LLM 서빙 파이프라인
Ray Serve를 활용한 ML/LLM 모델 서빙의 핵심 개념부터 멀티모델 파이프라인, 오토스케일링, 배치 추론, 프로덕션 배포까지 코드 예제와 함께 다룹니다.
2026-03-03 · 8 분 읽기 #ai-platform#ray-serve#model-serving#llm#mlopsSpeculative Decoding으로 LLM 추론 2~3배 빠르게: 원리부터 실전 구현까지
Speculative Decoding의 수학적 원리, Draft-Verify 파이프라인, 수용 확률 분석, vLLM/TensorRT-LLM에서의 실전 적용법, 그리고 Apple의 Mirror Speculative Decoding까지 심층 분석한다.
2026-03-02 · 9 분 읽기 #llm#speculative-decoding#inference#optimization#vllmvLLM을 넘어선 새로운 왕좌: SGLang이 LLM 인퍼런스의 판도를 바꾸는 5가지 이유
SGLang의 RadixAttention 기반 KV 캐시 관리, 29% 처리량 우위의 하이퍼 스페셜라이즈드 설계, 4000라인 Python Zero-Overhead 스케줄러, Prefill-Decode Disaggregation, Compressed FSM 기반 구조화된 생성까지 — vLLM을 넘어 차세대 LLM 인퍼런스 표준으로 부상한 SGLang의 5가지 혁신을 심층 분석한다.
2026-03-01 · 52 분 읽기 #sglang#llm-inference#vllm#radix-attention#model-serving