arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-05 至 2026-05-05 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2605.01208 2026-05-05 cs.AI 70%

Faithful Mobile GUI Agents with Guided Advantage Estimator

忠实的移动GUI代理与引导优势估计器

Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出Faithful-Agent框架,通过两阶段流程提升GUI交互的证据基础性和一致性,引入引导优势估计器GuAE,有效提升任务成功率并保持指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02439 2026-05-05 cs.LG cs.CV 62%

WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks

WebGym: 通过现实任务扩大视觉网络代理的训练环境

Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, Spencer Whitehead

机构 * Microsoft(微软) UIUC(伊利诺伊大学香槟分校) CMU(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 WebGym通过大规模现实任务和异步轨迹采样系统提升视觉网络代理训练效果,使基座模型在分布外测试集上的成功率显著提升。

Comments Completed acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01564 2026-05-05 cs.DB 50%

Actionable Understanding: Action Units for Bridging the Knowledge-Action Gap in Post-FAIR Knowledge Infrastructures

可操作的理解:用于弥合后FAIR知识基础设施中知识-行动鸿沟的行动单元

Lars Vogt

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出行动单元作为知识-行动鸿沟的解决方案,通过结构化扩展计划规范,明确适用条件和上下文基础,构建可操作的知识基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏