标签: #slo
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
会被读的仪表盘与值得呼人的告警 — 定义问题、组织变量、SLO 与告警疲劳
仪表盘的价值不在于好看,而在于能按顺序回答一组固定的问题。本文讲在动手做面板之前先写下要回答的问题,再讲数据源和变量该怎么组织,才能让一个仪表盘在多个环境里复用。文中用案例说明为什么告警该挂在症状而不是原因上,并把 SLO、错误预算、多窗口燃烧率告警写成真实的规则。最后整理出减少告警疲劳的规则,以及把仪表盘当作代码来管理的方法。内容以 Grafana 12 系列和 Prometheus 3.13 LTS 为准。
2026-08-02 · 21 分钟阅读 #observability#grafana#alerting#slo#dashboards平均响应时间为什么在撒谎 — 正确读懂 p50、p95 与 p99
平均响应时间只有 80ms 的服务,用户却要等上 3 秒,这种事很常见。本文用数字说明:在长尾分布中平均值究竟隐藏了什么,p50、p95、p99、p99.9 各自回答哪个问题,以及 p99 为什么不是「一百个人里有一个」。文中讲清百分位无法求平均这一决定性事实、由此必须使用直方图的理由,以及 Prometheus histogramquantile 的线性插值误差与选择桶边界的标准。最后整理出应把延迟 SLO 定义为比率而非百分位的实务
2026-07-26 · 15 分钟阅读 #observability#percentile#prometheus#histogram#slo凌晨三点不会把你叫醒的告警设计 — 症状告警与燃烧率实战
on-call 之所以崩溃,不是因为告警太少,而是因为太多。本文从告警疲劳如何让人错过真实事故的机制讲起,讲清「只对症状呼叫、把原因留在仪表盘上」这一原则,以及从 SLO 与错误预算倒推阈值的方法。文中用 Prometheus 规则和 promtool 测试展示:把短窗口与长窗口用 AND 串起来的多窗口燃烧率告警如何同时兼顾灵敏度与误报,以及 for 子句防止抖动的原理是什么。最后整理出在 CI 里强制 runbook 链接、并定期删
2026-07-26 · 18 分钟阅读 #observability#alerting#slo#error-budget#prometheusObservability 2025 完全指南:OpenTelemetry、Grafana / Datadog / Honeycomb / SigNoz、SLO 与 Error Budget、LLM 可观测性(2025)
Season 5 Ep 8。没有可观测性就没有运维,没有运维就没有产品。OpenTelemetry 三大信号(Metric、Log、Trace)的统一,Grafana 技术栈(Prometheus、Loki、Tempo、Mimir)与 Datadog、New Relic、Splunk 的比较,SigNoz、Honeycomb、Axiom 这一新世代,SLO、SLI、Error Budget 的运营,LLM 可观测性(LangFuse、L
2026-04-15 · 15 分钟阅读 #observability#opentelemetry#grafana#datadog#honeycomb