标签: #monitoring
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
原生直方图已经 stable 了,为什么还不能打开
2022年11月在 v2.40 中以实验特性登场的 Prometheus 原生直方图(native histograms),于2025年12月的 3.8.0 版本中转为 stable,而2026年7月1日发布的 3.13 是第一个以 stable 状态收录该特性的 LTS 版本。现有的 3.5 LTS 将于2026年7月31日停止支持,因此对走 LTS 路线的组织来说,现在正是真正需要做决定的时候。不过「stable」这个词所保证的范围
2026-07-16 · 26 分钟阅读 #prometheus#observability#native-histograms#metrics#monitoringLLMOps 平台构建指南:模型部署、监控与 A/B 测试实战架构
本文讲解 LLMOps 平台的设计与实现。涵盖基于 vLLM/TGI 的模型服务、token 使用量/延迟/质量监控、提示词版本管理、A/B 测试框架、护栏(Guardrails)集成,用代码构建生产环境 LLM 运维的完整生命周期。
2026-03-13 · 20 分钟阅读 #ai-platform#llmops#model-serving#monitoring#ab-testingnginx 配置完全指南:从架构到生产优化的 15 个核心主题
从 nginx 的事件驱动架构和配置结构,到反向代理、负载均衡、SSL/TLS、缓存、Rate Limiting、安全响应头、性能调优、健康检查 —— 用实战示例完整梳理可在生产环境立即落地的 15 项核心配置。
2026-03-01 · 41 分钟阅读 #nginx#reverse-proxy#load-balancing#ssl#tls