标签: #prompt-injection
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injection一个 Issue,捅穿整条供应链 — CI 里的智能体是怎么垮的,以及防御到底买到了多少时间
2026 年 6 月 1 日,GMO Flatt Security 的 RyotaK 公开的 Claude Code GitHub Actions 漏洞,完整追踪了闯入 CI 流水线的智能体是如何变成一条能把整个仓库拱手让出的通道的。一行“是机器人就放行”的判断击穿了信任边界,埋在 issue 正文里的指令变成了命令,一条看似只读的命令变成了泄露通道。本文在架构层面拆解了这条路径,并逐一剖析了 Anthropic 实际部署的防御手段。同
2026-07-16 · 33 分钟阅读 #security#ai#prompt-injection#supply-chain#ci-cdWeb 智能体把网页文字当作命令来读 — 跨站提示注入与 Prismata 的围堵
2026 年 7 月 9 日发布于 arXiv 的 Prismata 论文(Villa、Ozdarendeli、Tan、Popa)探讨了自主 Web 智能体最古老的弱点。由于智能体把自然语言解释为命令,混入页面的第三方内容与用户生成内容就能直接劫持智能体。作者们把这看作 Cross-Site Scripting 的重现。Prismata 提出一种"上下文最小权限"防御:从页面结构中导出信任、遮蔽不可信内容、并限制智能体的行动权限。文章也
2026-07-11 · 9 分钟阅读 #prompt-injection#web-agents#ai-security#least-privilege#browser-agentsLLM 安全完全指南:Prompt Injection、Jailbreak、Red Team、OWASP LLM Top 10、EU AI Act(2025)
2024–2025 年,LLM 产品的失败原因 TOP3 里总是有“安全事故”。Prompt injection 的 12 种变体、Jailbreak 手法、Data exfiltration、Model extraction、Red team 自动化(PyRIT/Garak)、OWASP LLM Top 10、EU AI Act 与韩国监管,以及护栏设计。教你做出“默认安全的 LLM 产品”。
2026-04-15 · 16 分钟阅读 #llm-security#prompt-injection#jailbreak#red-team#owasp-llmAI 系统安全工程:从提示词注入到模型安全
AI 系统安全完全指南。通过真实攻击案例与 Python 示例,学习提示词注入、越狱(Jailbreak)、数据投毒、模型提取、隐私攻击及防御策略。
2026-03-17 · 26 分钟阅读 #ai-security#prompt-injection#llm-security#adversarial-attack#jailbreak