タグ: #browser-agents
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
ブラウザ・コンピュータを操作するAIエージェントはいまどこまで来たか — ベンチマークの数字が実際に測っているもの
「コンピュータユースエージェントがOSWorldで83.5%を記録した」と「最強のエージェントでも20.6%しか完了できない」は、どちらも2026年に出た事実であり、どちらも正しいのです。前者はOSWorld 1.0、後者は同じチームが作ったOSWorld 2.0です。本稿ではその隔たりがどこから来るのかを、原論文とベンチマーク著者らの自己測定でたどります。OSWorldの課題の半分近くはGUIをほとんど使わずターミナルで解けるというE
2026-07-17 · 44 分で読めます #ai#computer-use#browser-agents#benchmark#prompt-injectionウェブエージェントはページの文章を命令として読む — クロスサイトプロンプトインジェクションとPrismataの封じ込め
2026年7月9日にarXivへ投稿されたPrismata論文(Villa、Ozdarendeli、Tan、Popa)は、自律型ウェブエージェントのもっとも古い弱点を扱います。エージェントは自然言語を命令として解釈するため、ページに混ざった第三者・ユーザー生成コンテンツがそのままエージェントを乗っ取れてしまいます。著者らはこれをCross-Site Scriptingの再来と見ます。Prismataは、ページ構造から信頼を導き、信頼でき
2026-07-11 · 11 分で読めます #prompt-injection#web-agents#ai-security#least-privilege#browser-agents