标签: #reliability
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
在生产环境里运维 AI 智能体 — 幂等性、预算,以及自信满满的错误答案
把智能体从原型搬到生产环境时,有一片会被很晚才发现的运维表面:被重试的工具调用的幂等性、预算与步数上限、非确定性控制流的可观测性、按工具划分的权限边界,以及智能体自信满满地答错时的升级路径。最近发到 GeekNews Ask GN 上的一份分析,在 6,780 条基准测试轨迹里找到了 8,042 次重复工具执行,其中 159 次是改变状态的工具真的创建出了重复资源。本文以那份数据为起点,梳理该记录什么、该对什么设告警,以及在像第三方 A
2026-07-31 · 24 分钟阅读 #ai#agents#observability#reliability#mcp限流算法怎么选 — 固定窗口、滑动窗口与令牌桶的真实差别
明明按每分钟 100 次拦着,却放过了 200 次,这不是 bug,而是固定窗口算法被定义好的行为。本文用表格比较固定窗口、滑动日志、滑动窗口计数器、令牌桶这四种做法在内存与精度上的取舍,并用数字把边界问题算清楚。还整理了分布式环境下为什么需要 Redis 的原子操作、按节点做本地限流会带来多大误差、以 IP 作为键会坏在哪里。最后讲怎么用 429 响应配合 Retry-After 和 RateLimit 系列头把状态告诉客户端,以及没
2026-07-26 · 17 分钟阅读 #web#rate-limiting#api-design#redis#reliabilityTemporal Worker Versioning GA — 回放模型制造的部署难题,抛弃两代之后拿出的第三个答案
像 Temporal 这样的持久执行引擎靠回放事件历史来扛住故障,而恰恰是这份回放,让「在有工作流正在运行时部署新代码」成了这套模型里最棘手的问题。Temporal 在 2026 年 3 月 30 日宣布了 Worker Versioning 的 GA,OSS 服务端则在 v1.31.0(4 月 29 日)里写明 — 距 2023 年 6 月首次预览已两年九个月,其间把两代版本化 API(版本集、版本化规则)整个抛弃后拿出的第三套设计。
2026-07-17 · 20 分钟阅读 #distributed-systems#durable-execution#temporal#workflow-engine#reliabilityAI 智能体在生产环境中是如何失败的 — 14 种失败模式,以及重试为何不安全
把智能体放上生产环境,会有三处疼。第一,失败大多不是出在模型,而是出在系统设计 — UC 伯克利的 MAST 研究对 1642 条执行轨迹做了分类,提炼出 14 种失败模式,其中 44.2% 属于系统设计问题。第二,最常见的两种失败模式(步骤重复 15.7%、未意识到终止条件 12.4%)会直接变成 token 账单。第三,恰恰是这两种模式制造了重试/幂等性问题 — 非确定性的调用方在驱动真实副作用,而 MCP 只给了 idempote
2026-07-17 · 32 分钟阅读 #ai#agents#observability#reliability#mcp支付幂等性:如何防止重复扣款
网络迟早会断开,一旦断开,客户端就会重试。可在支付场景里,重试可能变成重复扣款。幂等键、去重窗口、唯一约束、重试与超时问题、给 at-least-once 投递加上 dedup、把支付建模为状态机,直到 Stripe 风格的幂等性实现 — 本文梳理了如何让一笔钱只被扣一次。
2026-07-02 · 22 分钟阅读 #payments#idempotency#reliabilityExactly-once 是幻觉吗:支付与消息传递的正确性
投递保证的三个等级(at-most-once、at-least-once、exactly-once)究竟意味着什么,为什么 exactly-once「投递」原理上不可能,而 exactly-once「处理」却可以通过幂等性、去重、事务性发件箱来达成,两个将军问题告诉我们的道理,以及 Kafka 的 exactly-once 到底保证了什么。冷静地梳理支付与消息传递的正确性。
2026-06-28 · 22 分钟阅读 #distributed-systems#messaging#reliability限流算法全面解析:固定窗口、滑动窗口、令牌桶与漏桶
从固定窗口、滑动窗口日志与计数器,到令牌桶、漏桶,逐一对比几种具有代表性的限流算法。梳理各算法如何处理突发流量、如何用 Redis 在分布式环境中实现,以及 429 与 Retry-After、客户端的退避礼仪。
2026-06-25 · 17 分钟阅读 #systems#api#reliability幂等性与重试:构建可靠的 API
网络迟早会失败,失败了就得重试。棘手的情形是「已经处理完了,只是响应没送到」。本文梳理幂等性是什么、哪些 HTTP 方法安全、哪些不安全,POST 的幂等性键,「恰好一次」这个神话,以及指数退避加抖动如何避免惊群效应。
2026-06-21 · 20 分钟阅读 #api#reliability#distributed-systems著名事后复盘解剖 — 从 Cloudflare·Fastly·AWS·Knight Capital·GitLab 的失败中学习
Cloudflare 2022 BGP、Fastly 2021 让半个互联网下线、AWS S3 2017 的一个笔误、Knight Capital 8 分钟 $440M、GitLab 的 DB wipe 等 — 从著名失败中提炼出的模式与教训。
2026-04-15 · 16 分钟阅读 #postmortem#sre#outage#reliability#cultureCloudflare AI Gateway 实战指南: 观测和控制 AI 流量最快的方法
以 2026 年 4 月为基准,从实务角度梳理为什么要用 Cloudflare AI Gateway、能做哪些控制、以及应该如何搭配使用 Dynamic Routing 与自动重试。
2026-04-12 · 9 分钟阅读 #ai-platform#cloudflare#ai-gateway#observability#caching