标签: #agents
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
在生产环境里运维 AI 智能体 — 幂等性、预算,以及自信满满的错误答案
把智能体从原型搬到生产环境时,有一片会被很晚才发现的运维表面:被重试的工具调用的幂等性、预算与步数上限、非确定性控制流的可观测性、按工具划分的权限边界,以及智能体自信满满地答错时的升级路径。最近发到 GeekNews Ask GN 上的一份分析,在 6,780 条基准测试轨迹里找到了 8,042 次重复工具执行,其中 159 次是改变状态的工具真的创建出了重复资源。本文以那份数据为起点,梳理该记录什么、该对什么设告警,以及在像第三方 A
2026-07-31 · 24 分钟阅读 #ai#agents#observability#reliability#mcpAI 智能体在生产环境中是如何失败的 — 14 种失败模式,以及重试为何不安全
把智能体放上生产环境,会有三处疼。第一,失败大多不是出在模型,而是出在系统设计 — UC 伯克利的 MAST 研究对 1642 条执行轨迹做了分类,提炼出 14 种失败模式,其中 44.2% 属于系统设计问题。第二,最常见的两种失败模式(步骤重复 15.7%、未意识到终止条件 12.4%)会直接变成 token 账单。第三,恰恰是这两种模式制造了重试/幂等性问题 — 非确定性的调用方在驱动真实副作用,而 MCP 只给了 idempote
2026-07-17 · 32 分钟阅读 #ai#agents#observability#reliability#mcp模拟客户从不离开 — LLM 用户模拟器在哪里把智能体的分数吹高了
在 τ-bench 这一类对话式智能体基准测试里,"用户"这个角色由另一个 LLM 来扮演。可这个模拟器不是被测量的对象,而是测量工具本身,工具是需要校准的。2026 年发表的三项验证研究都指向同一个方向 — 模拟出来的用户太配合了。一项把 τ-bench 协议原样搬给 451 名真人跑的研究报告说,模拟器制造出的"简单模式"会把智能体的成功率推到高于人类基线的水平;另一项研究报告说,换一个用户 LLM,成功率最多能摆动 9 个百分点。
2026-07-16 · 36 分钟阅读 #ai#llm#evaluation#agents#simulationMCP 甩掉会话 — 读懂 2026-07-28 修订版的无状态核心
MCP 规范的下一个修订版 2026-07-28,是发布以来最大的一次变更。核心是把状态从协议层剥离出去 — initialize 握手和 Mcp-Session-Id 会话消失了,所有请求都在 meta 里携带协议版本和客户端能力来自我说明。作为代价,服务器反问客户端的方式被 MRTR(Multi Round-Trip Requests)彻底翻转,SSE 断线重连(resumability)被移除,Roots/Sampling/Log
2026-07-16 · 27 分钟阅读 #mcp#ai#protocol#agents#integrationModel Context Protocol(MCP)参考手册 — 将 AI 连接到外部世界的开放标准
Model Context Protocol(MCP)是一个把应用向 LLM 提供上下文的方式标准化的开放协议。本文是一份基于官方文档、面向工程师的 MCP 参考 — 为什么它能解决 M×N 集成问题,主机、客户端、服务器结构与两个层(数据/传输),三种服务器原语(工具、资源、提示),stdio 与 Streamable HTTP 传输。还涵盖了如何设计服务器,以及安全性、成熟度上诚实的取舍。
2026-07-11 · 10 分钟阅读 #mcp#ai#agents#llm#protocol解读 Microsoft Flint — 让智能体绘制图表的可视化语言
Microsoft Research 公开的 Flint 并不是可视化智能体的语言,而是让 AI 智能体能够从数据中稳定地生成美观图表的中间语言。编译器会代替我们,从数据与语义类型中推导出比例尺、坐标轴、颜色、布局等低层决策,并把同一份规格编译为 Vega-Lite、ECharts、Chart.js。本文诚实地探讨 Flint 究竟是什么、解决了什么问题,以及智能体专用的可视化语言究竟是真正必要的构想,还是过度设计。
2026-07-11 · 9 分钟阅读 #ai#agents#data-visualization#llm#microsoft编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarks构建高效的 AI 智能体 — 五种工作流模式与智能体参考指南
把 Anthropic 的工程指南《Building Effective Agents》整理成了一份实战参考。文中厘清工作流与智能体的准确区分,介绍作为一切基础的增强型 LLM(检索·工具·记忆),并逐一讲解五种工作流模式(提示链·路由·并行化·编排者-工作者·评估者-优化者)各自的适用场景与示例。同时坦诚地写下自主智能体究竟是什么、何时该用智能体取代工作流,以及过度设计·失控循环·成本/延迟等失败模式。目标是为开发者和 AI 智能体提
2026-07-11 · 14 分钟阅读 #ai#agents#llm#engineering#anthropic为每一步选择该思考多少 — Ares 的自适应推理努力路由
本文从实践角度梳理了 Ares(2026 年 3 月的预印本)。这篇论文把推理努力当作以步骤为单位的成本杠杆,而不是任务整体层面的选择。一个轻量级路由器查看交互历史,预测每一步所需的最低推理级别,从而减少让所有步骤都以最大努力运行的浪费。作者报告称,在 TAU-Bench、BrowseComp-Plus、WebArena 上,推理 token 最多削减了 52.7%,而成功率下降甚微——但这是未经独立验证的作者自报数值。本文一并讨论路由
2026-07-11 · 7 分钟阅读 #ai#agents#llm#efficiency从 UniClawBench 看 2026 年的智能体基准测试 — 存活容器与隐藏的监督者
香港大学(HKU)MMLab 于 2026 年 7 月投稿到 arXiv 的 UniClawBench,是一个标榜"能力驱动(capability-driven)"的主动式智能体基准测试。它不再与预先静态记录好的标准答案做比对,而是在存活的 Docker 容器中用步骤级检查点来评分,并以执行者、隐藏的监督者、用户智能体组成的闭环来模拟多轮反馈。其核心在于:把 400 个双语任务划分为五种能力,并力图将基座模型的实力与智能体框架的设计分开
2026-07-11 · 9 分钟阅读 #ai#agents#evaluation#benchmark#llm