标签: #browser-agents
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injectionWeb 智能体把网页文字当作命令来读 — 跨站提示注入与 Prismata 的围堵
2026 年 7 月 9 日发布于 arXiv 的 Prismata 论文(Villa、Ozdarendeli、Tan、Popa)探讨了自主 Web 智能体最古老的弱点。由于智能体把自然语言解释为命令,混入页面的第三方内容与用户生成内容就能直接劫持智能体。作者们把这看作 Cross-Site Scripting 的重现。Prismata 提出一种"上下文最小权限"防御:从页面结构中导出信任、遮蔽不可信内容、并限制智能体的行动权限。文章也
2026-07-11 · 9 分钟阅读 #prompt-injection#web-agents#ai-security#least-privilege#browser-agents