标签: #latency
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
平均值什么也说明不了——如何用分布调试延迟
2026 年 7 月 27 日发布、登上 Hacker News 榜首的 Farid Zakaria 文章《The mean means nothing》,讨论了这样一种情形:部署缓存层之后,平均延迟从 112ms 恶化到 122ms,上升了 9%。而在同一份数据中,p50 从 99ms 改善到 54ms,下降了 46%;p99 则从 309ms 恶化到 678ms,上升了 119%。同一份数据之所以能同时支持两个截然相反的结论,是因为
2026-07-31 · 22 分钟阅读 #observability#latency#performance#histogram#percentile提示词缓存实战指南:让 Agent 应用的成本与延迟一起降下来
梳理为什么提示词缓存在 Agent 应用里很重要、OpenAI 与 Anthropic 的差异、提示词结构化模式、ROI 判断方法、常见错误,以及迁移清单,全部从实务角度整理。
2026-04-12 · 13 分钟阅读 #prompt-caching#latency#cost-optimization#ai-agent#llmops