태그: #browser-agents
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
브라우저·컴퓨터를 조작하는 AI 에이전트, 지금 어디까지 왔나 — 벤치마크 숫자가 실제로 재는 것
"컴퓨터 유즈 에이전트가 OSWorld에서 83.5%를 찍었다"와 "가장 강한 에이전트도 20.6%밖에 못 끝낸다"는 둘 다 2026년에 나온 사실이고, 둘 다 맞습니다. 앞은 OSWorld 1.0, 뒤는 같은 팀이 만든 OSWorld 2.0입니다. 이 글은 그 간극이 어디서 오는지를 원 논문과 벤치마크 저자들의 자체 측정으로 따라갑니다. OSWorld 과제의 절반 가까이는 GUI를 거의 쓰
2026-07-17 · 46 분 읽기 #ai#computer-use#browser-agents#benchmark#prompt-injection웹 에이전트는 웹페이지의 글을 명령으로 읽는다 — 교차 사이트 프롬프트 인젝션과 Prismata의 봉쇄
2026년 7월 9일 arXiv에 올라온 Prismata 논문(Villa, Ozdarendeli, Tan, Popa)은 자율 웹 에이전트의 가장 오래된 약점을 다룹니다. 에이전트는 자연어를 명령으로 해석하기 때문에, 페이지에 섞인 제3자·사용자 생성 콘텐츠가 그대로 에이전트를 탈취할 수 있습니다. 저자들은 이를 Cross-Site Scripting의 재림으로 봅니다. Prismata는 신뢰를
2026-07-11 · 11 분 읽기 #prompt-injection#web-agents#ai-security#least-privilege#browser-agents