CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准
机构 * Macau University of Science and Technology(澳门科技大学) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; FellouAI ; ARGUS Lab(ARGUS实验室) ; The University of Edinburgh(爱丁堡大学)
AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。
Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/