标签: #llmops
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
LLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registryLLMOps 完全指南:模型 · 提示词 · 评测集三轴版本管理、Canary、成本控制、平台团队 (2025)
把 LLM 产品做出来的方法已经变简单了,难的是让它可持续地跑下去。模型 · 提示词 · 评测集的三轴版本管理,Shadow/Canary/Blue-Green 发布,用 token、缓存与模型路由做成本控制,组织结构(AI 平台/Model 平台/Product AI),失败案例,直到 KPI 与 on-call。它是 MLOps 的延长线,同时正面处理 LLM 特有的课题。
2026-04-15 · 15 分钟阅读 #llmops#mlops#devops#canary#cost-control提示词缓存实战指南:让 Agent 应用的成本与延迟一起降下来
梳理为什么提示词缓存在 Agent 应用里很重要、OpenAI 与 Anthropic 的差异、提示词结构化模式、ROI 判断方法、常见错误,以及迁移清单,全部从实务角度整理。
2026-04-12 · 13 分钟阅读 #prompt-caching#latency#cost-optimization#ai-agent#llmops把 Gemini API 送上生产环境需要的 Prompt、Guardrails、Evaluation
从运维视角梳理把 Gemini API 接入实际服务时所需的提示词设计、structured output、safety 策略、评估循环、成本控制方法的一份指南。
2026-03-17 · 7 分钟阅读 #gemini#generative-ai#ai#llmops#prompt-engineeringMLOps 与模型生命周期管理:MLflow、DVC 与 LLMOps 完全指南
从 MLOps 成熟度模型到 MLflow 实验追踪、DVC 数据版本管理、特征存储,再到 LLMOps,一份实战导向的 ML 流水线完全指南。
2026-03-17 · 23 分钟阅读 #mlops#mlflow#dvc#llmops#피처스토어LLMOps 平台构建指南:模型部署、监控与 A/B 测试实战架构
本文讲解 LLMOps 平台的设计与实现。涵盖基于 vLLM/TGI 的模型服务、token 使用量/延迟/质量监控、提示词版本管理、A/B 测试框架、护栏(Guardrails)集成,用代码构建生产环境 LLM 运维的完整生命周期。
2026-03-13 · 20 分钟阅读 #ai-platform#llmops#model-serving#monitoring#ab-testing