arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

同一个GPT-5 mini只换操作界面,成功率从83.1%跌到48.9%

arXiv 2608.18307 cs · cs.AI · cs.CL · cs.HC

GPT-5 mini操作同一批网页组件,只把观察与动作方式从无障碍树换成纯截图坐标,任务成功率就从83.1%降到48.9%。杜克大学、亚马逊AGI旧金山实验室提出ComponentBench,把按钮组、筛选表格、拖拽和富文本编辑器等97类组件拆成2910项可程序验证任务。

过去评测常在两端取样:要么是跨多个页面的长流程,要么是“点这个按钮”的原子定位。中间层的真实组件交互很少被单独测量,智能体失败后难以判断是看不懂界面、选错实例,还是动作序列不完整。

97类组件覆盖网页交互的中间地带

ComponentBench把现代网页界面整理成14个家族,包括选择、日期时间、数据展示、导航、反馈、拖放和高级编辑器。任务分别基于Ant Design、MUI与Mantine实现,测试不绑定某一家组件库的DOM结构。

ComponentBench组件家族

论文Figure 1:97类标准组件被归入14个家族,并在三套常用前端组件库中实例化。

每道题同时保留自然语言指令、结构化元数据、人工参考轨迹和程序验证器。验证器检查最终状态,不只看是否点击了某个坐标;这能容纳不同但有效的操作路径,也能统计比人类多走了多少步。

看似相同的三张表,必须找到正确实例

一项示例任务在页面上放了三张外观相近的小表格。指令要求修改Invoices表,设置两个筛选条件并点击该表自己的Apply按钮。智能体需要先区分组件实例,再打开正确控件、输入条件并提交。

可筛选表格任务示例

论文Figure 2:同页多个相似表格要求智能体定位Invoices实例,设置两项筛选并在局部按钮上提交。

这类任务比单次点选多一层状态,又比跨站购物流程短,失败能归到明确组件。数据经过程序验证,人工轨迹还用于衡量操作效率,而不只是最终是否完成。

四种界面方式把模型排名也改了

团队比较Browser-Use工具、无障碍树、带编号标记的截图和纯像素坐标四种观察—动作空间,评测七个模型。GPT-5 mini在无障碍树上为83.1%,纯像素为48.9%,相差34.2个百分点;若把工具更丰富的Browser-Use也算入,最高87.0%。

界面影响不是单向的。弱视觉模型常从结构化树或编号标记获益,但GPT-5.4 mini和GPT-5.4在纯像素上反而比编号标记高2.4和6.8个百分点。拖放偏向像素操作,高级编辑器则更适合Browser-Use。

模型、组件家族与观察方式热力图

论文Figure 3:不同组件家族的模式排序会反转,拖放与高级编辑器呈现不同偏好。

这些结果来自同一测试框架,说明“模型成功率”必须同时写明界面表示和动作工具。它不能直接用于比较不同厂商在各自优化过的产品代理,因为提示词、浏览器封装和恢复策略都可能不同。

做对任务后,效率差距仍然很大

即使在最快配置下,智能体完成匹配任务仍花费人工参考时间的3.7倍。空间操控对人很直观,对模型却需要反复观察、定位和确认;有些模型通过更多步骤换来成功率,不能只用最终通过率评价。

基准同时统计参考步数以内和两倍参考步数以内的完成比例。产品部署可据此区分“偶尔能做完”和“能按用户可接受的时间做完”,也能定位等待来自感知、规划还是冗余点击。

下一步是把组件诊断接回长流程

ComponentBench适合做模型和浏览器代理的回归测试:升级视觉编码、DOM提取或动作API后,可以直接看到哪类组件改善或退化。后续还需加入移动端手势、画布、复杂弹窗和动态加载,并测试组件被嵌入跨页面流程后的错误传播。

企业采用电脑智能体时,也应记录实际产品界面使用了哪种观察空间。论文已证明,仅换接口就足以产生30个百分点以上差距;脱离接口谈单一“智能体能力”,很容易把工具优势误写成模型能力。

参考资料

https://arxiv.org/abs/2608.18307

https://componentbench.com

https://github.com/TianchenGuan/ComponentBench