标签: #error-budget
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
凌晨三点不会把你叫醒的告警设计 — 症状告警与燃烧率实战
on-call 之所以崩溃,不是因为告警太少,而是因为太多。本文从告警疲劳如何让人错过真实事故的机制讲起,讲清「只对症状呼叫、把原因留在仪表盘上」这一原则,以及从 SLO 与错误预算倒推阈值的方法。文中用 Prometheus 规则和 promtool 测试展示:把短窗口与长窗口用 AND 串起来的多窗口燃烧率告警如何同时兼顾灵敏度与误报,以及 for 子句防止抖动的原理是什么。最后整理出在 CI 里强制 runbook 链接、并定期删
2026-07-26 · 18 分钟阅读 #observability#alerting#slo#error-budget#prometheusObservability 2025 完全指南:OpenTelemetry、Grafana / Datadog / Honeycomb / SigNoz、SLO 与 Error Budget、LLM 可观测性(2025)
Season 5 Ep 8。没有可观测性就没有运维,没有运维就没有产品。OpenTelemetry 三大信号(Metric、Log、Trace)的统一,Grafana 技术栈(Prometheus、Loki、Tempo、Mimir)与 Datadog、New Relic、Splunk 的比较,SigNoz、Honeycomb、Axiom 这一新世代,SLO、SLI、Error Budget 的运营,LLM 可观测性(LangFuse、L
2026-04-15 · 15 分钟阅读 #observability#opentelemetry#grafana#datadog#honeycomb