标签: #percentile
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
平均值什么也说明不了——如何用分布调试延迟
2026 年 7 月 27 日发布、登上 Hacker News 榜首的 Farid Zakaria 文章《The mean means nothing》,讨论了这样一种情形:部署缓存层之后,平均延迟从 112ms 恶化到 122ms,上升了 9%。而在同一份数据中,p50 从 99ms 改善到 54ms,下降了 46%;p99 则从 309ms 恶化到 678ms,上升了 119%。同一份数据之所以能同时支持两个截然相反的结论,是因为
2026-07-31 · 22 分钟阅读 #observability#latency#performance#histogram#percentile平均响应时间为什么在撒谎 — 正确读懂 p50、p95 与 p99
平均响应时间只有 80ms 的服务,用户却要等上 3 秒,这种事很常见。本文用数字说明:在长尾分布中平均值究竟隐藏了什么,p50、p95、p99、p99.9 各自回答哪个问题,以及 p99 为什么不是「一百个人里有一个」。文中讲清百分位无法求平均这一决定性事实、由此必须使用直方图的理由,以及 Prometheus histogramquantile 的线性插值误差与选择桶边界的标准。最后整理出应把延迟 SLO 定义为比率而非百分位的实务
2026-07-26 · 15 分钟阅读 #observability#percentile#prometheus#histogram#slo