标签: #metrics
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
设计能回答问题的 Prometheus 指标 —— 类型选择、基数预算,以及 rate 和分位数的陷阱
指标不是越多越好,能回答问题才有价值。本文先讲清楚 Counter、Gauge、Histogram 各自回答什么问题,选错了会让哪些计算在原理上变得不可能。接着讲怎么用数字而不是直觉给标签基数定预算,rate 和 histogramquantile 在什么条件下会悄悄给出错误答案,以及什么时候该建 recording rule、该起什么名字。最后留下五个在做面板之前应该问自己的问题。内容以 Prometheus 3.13 LTS 为准验
2026-08-02 · 24 分钟阅读 #observability#prometheus#promql#metrics#cardinality文本、图像、智能体分别怎么测 —— 三个领域的测量为何根本不同
文本、图像、智能体都在用"性能"这同一个词,但测量结构完全不同。文本分裂成假装有正确答案的选择题和没有正确答案的生成式任务;图像的分布距离和人类判断对不上;智能体则因为部分成功、环境状态、非确定性,从一开始就无法压缩成一个数字。本文在定义层面拆解各领域代表性指标实际计算的是什么,并为每个领域各配上一个"指标很高但实际很差"的案例。最后用一张表总结领域、任务、指标,以及每个指标遗漏了什么。
2026-08-02 · 32 分钟阅读 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics重构的经济学:什么时候能回本 — 用变更频率计算
2026年7月30日发布在martinfowler.com上的The Economic Benefit of Refactoring一文,对一个约1.7万行的模块进行了15步重构,每一步都重新执行同一个变更请求,测得输入token从159,564个降到27,360个,减少了83%。这是个有意思的实验,但作者本人明确指出这只是单次实验,而且只针对一个绿地(greenfield)应用。本文把这个实验和既有证据(Tornhill与Borg针对
2026-07-31 · 22 分钟阅读 #refactoring#engineering#technical-debt#ai#metrics原生直方图已经 stable 了,为什么还不能打开
2022年11月在 v2.40 中以实验特性登场的 Prometheus 原生直方图(native histograms),于2025年12月的 3.8.0 版本中转为 stable,而2026年7月1日发布的 3.13 是第一个以 stable 状态收录该特性的 LTS 版本。现有的 3.5 LTS 将于2026年7月31日停止支持,因此对走 LTS 路线的组织来说,现在正是真正需要做决定的时候。不过「stable」这个词所保证的范围
2026-07-16 · 26 分钟阅读 #prometheus#observability#native-histograms#metrics#monitoring成功的公司是如何失明的 — 工程组织的能力失明
Ian Reppel 的文章指出,成功的公司会陷入他所称的"能力失明(competence blindness)"状态。就像墨西哥洞穴鱼主动抑制自己的眼睛一样,由于环境不再给予回报,公司也不再表现出那种细致的工程能力。这不是单纯的放任,而是主动的抑制,也与经典的颠覆式创新不同。本文先忠实地转述这一主张,再看它如何在工程组织中显现:无人敢质疑的遗留系统、现实在腐烂时却依然一片绿色的仪表盘,以及像瘢痕组织一样僵化的流程。
2026-07-11 · 14 分钟阅读 #engineering-culture#organizations#legacy#metrics#leadership