标签: #alerting
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
会被读的仪表盘与值得呼人的告警 — 定义问题、组织变量、SLO 与告警疲劳
仪表盘的价值不在于好看,而在于能按顺序回答一组固定的问题。本文讲在动手做面板之前先写下要回答的问题,再讲数据源和变量该怎么组织,才能让一个仪表盘在多个环境里复用。文中用案例说明为什么告警该挂在症状而不是原因上,并把 SLO、错误预算、多窗口燃烧率告警写成真实的规则。最后整理出减少告警疲劳的规则,以及把仪表盘当作代码来管理的方法。内容以 Grafana 12 系列和 Prometheus 3.13 LTS 为准。
2026-08-02 · 21 分钟阅读 #observability#grafana#alerting#slo#dashboards凌晨三点不会把你叫醒的告警设计 — 症状告警与燃烧率实战
on-call 之所以崩溃,不是因为告警太少,而是因为太多。本文从告警疲劳如何让人错过真实事故的机制讲起,讲清「只对症状呼叫、把原因留在仪表盘上」这一原则,以及从 SLO 与错误预算倒推阈值的方法。文中用 Prometheus 规则和 promtool 测试展示:把短窗口与长窗口用 AND 串起来的多窗口燃烧率告警如何同时兼顾灵敏度与误报,以及 for 子句防止抖动的原理是什么。最后整理出在 CI 里强制 runbook 链接、并定期删
2026-07-26 · 18 分钟阅读 #observability#alerting#slo#error-budget#prometheus