标签: #model-serving
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
LLMOps 平台构建指南:模型部署、监控与 A/B 测试实战架构
本文讲解 LLMOps 平台的设计与实现。涵盖基于 vLLM/TGI 的模型服务、token 使用量/延迟/质量监控、提示词版本管理、A/B 测试框架、护栏(Guardrails)集成,用代码构建生产环境 LLM 运维的完整生命周期。
2026-03-13 · 20 分钟阅读 #ai-platform#llmops#model-serving#monitoring#ab-testingKServe 模型服务完全指南:InferenceService、Canary 部署、Transformer、InferenceGraph 生产运维
本文讲解基于 Kubernetes、使用 KServe 进行模型服务的实践。涵盖用 InferenceService CRD 部署模型、用 Canary 策略实现安全上线、用 Transformer 搭建前后处理流水线、用 InferenceGraph 构建基于 DAG 的复合推理,并配合代码给出生产运维策略的落地实现。
2026-03-12 · 22 分钟阅读 #ai-platform#kserve#model-serving#kubernetes#inference-graphRay Serve 模型服务平台构建指南 — 自动扩缩容、多模型、生产部署
结合实战代码,全面梳理 Ray Serve 的架构、LLM 模型服务部署、自动扩缩容、多模型模式与 KubeRay 运维。
2026-03-09 · 23 分钟阅读 #ai-platform#ray-serve#model-serving#kuberay#mlopsNVIDIA Triton Inference Server 生产指南:GPU 模型服务优化策略
基于 NVIDIA Triton Inference Server 的 GPU 模型服务优化指南。涵盖 Dynamic Batching、Model Ensemble、TensorRT 集成、多模型服务、Kubernetes 部署、性能画像分析与生产环境故障排查。
2026-03-08 · 38 分钟阅读 #ai-platform#triton#inference-server#gpu#model-serving用 BentoML 搭建 ML 模型服务流水线:从打包到 Kubernetes 部署
一份关于用 BentoML 做 ML 模型服务的实战指南。涵盖模型打包、API 实现、多模型流水线、Docker 构建,直到 Kubernetes 部署。
2026-03-03 · 7 分钟阅读 #ai-platform#bentoml#model-serving#mlops#kubernetes用 Ray Serve 构建可扩展的 LLM 服务流水线
从 Ray Serve 支撑的 ML/LLM 模型服务核心概念开始,一路讲到多模型流水线、自动伸缩、批量推理与生产部署,并配有代码示例。
2026-03-03 · 7 分钟阅读 #ai-platform#ray-serve#model-serving#llm#mlopsKubernetes ML 模型服务:KServe 与 NVIDIA Triton 完全解析
基于 KServe 与 NVIDIA Triton 官方文档,系统性地分析 Kubernetes 环境下的 ML 模型服务架构。
2026-03-01 · 25 分钟阅读 #mlops#kubernetes#model-serving#kserve#triton