标签: #prometheus
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
设计能回答问题的 Prometheus 指标 —— 类型选择、基数预算,以及 rate 和分位数的陷阱
指标不是越多越好,能回答问题才有价值。本文先讲清楚 Counter、Gauge、Histogram 各自回答什么问题,选错了会让哪些计算在原理上变得不可能。接着讲怎么用数字而不是直觉给标签基数定预算,rate 和 histogramquantile 在什么条件下会悄悄给出错误答案,以及什么时候该建 recording rule、该起什么名字。最后留下五个在做面板之前应该问自己的问题。内容以 Prometheus 3.13 LTS 为准验
2026-08-02 · 24 分钟阅读 #observability#prometheus#promql#metrics#cardinality平均响应时间为什么在撒谎 — 正确读懂 p50、p95 与 p99
平均响应时间只有 80ms 的服务,用户却要等上 3 秒,这种事很常见。本文用数字说明:在长尾分布中平均值究竟隐藏了什么,p50、p95、p99、p99.9 各自回答哪个问题,以及 p99 为什么不是「一百个人里有一个」。文中讲清百分位无法求平均这一决定性事实、由此必须使用直方图的理由,以及 Prometheus histogramquantile 的线性插值误差与选择桶边界的标准。最后整理出应把延迟 SLO 定义为比率而非百分位的实务
2026-07-26 · 15 分钟阅读 #observability#percentile#prometheus#histogram#slo凌晨三点不会把你叫醒的告警设计 — 症状告警与燃烧率实战
on-call 之所以崩溃,不是因为告警太少,而是因为太多。本文从告警疲劳如何让人错过真实事故的机制讲起,讲清「只对症状呼叫、把原因留在仪表盘上」这一原则,以及从 SLO 与错误预算倒推阈值的方法。文中用 Prometheus 规则和 promtool 测试展示:把短窗口与长窗口用 AND 串起来的多窗口燃烧率告警如何同时兼顾灵敏度与误报,以及 for 子句防止抖动的原理是什么。最后整理出在 CI 里强制 runbook 链接、并定期删
2026-07-26 · 18 分钟阅读 #observability#alerting#slo#error-budget#prometheus原生直方图已经 stable 了,为什么还不能打开
2022年11月在 v2.40 中以实验特性登场的 Prometheus 原生直方图(native histograms),于2025年12月的 3.8.0 版本中转为 stable,而2026年7月1日发布的 3.13 是第一个以 stable 状态收录该特性的 LTS 版本。现有的 3.5 LTS 将于2026年7月31日停止支持,因此对走 LTS 路线的组织来说,现在正是真正需要做决定的时候。不过「stable」这个词所保证的范围
2026-07-16 · 26 分钟阅读 #prometheus#observability#native-histograms#metrics#monitoring