arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2603.21142 2026-03-24 cs.RO 82%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08935 2026-03-24 cs.RO cs.CV 57%

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

拓展你的SCOPE:基于潜在探索的语义认知用于具身视觉导航

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过利用前沿信息驱动潜在探索,提升具身视觉导航中的决策质量与目标相关性,实验表明其在准确性和泛化能力上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 57%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10154 2026-03-24 cs.RO 50%

CompassNav: Steering From Path Imitation To Decision Understanding In Navigation

CompassNav: 从路径模仿到决策理解的导航导航

LinFeng Li, Jian Zhao, Yuan Xie, Xin Tan, Xuelong Li

机构 * East China Normal University(东华师范大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出CompassNav方法,通过引入Compass-Data-22k数据集和gap-aware奖励函数,使导航代理能理解而非单纯模仿路径,实现更高效的导航性能。

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21263 2026-03-24 cs.SE 50%

From Natural Language to Executable Properties for Property-based Testing of Mobile Apps

从自然语言到可执行属性:用于移动应用基于属性测试的可执行属性

Yiheng Xiong, Ting Su, Jingling Sun, Jue Wang, Qin Li, Geguang Pu, Zhendong Su

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出了一种新的结构化属性合成方法,将自然语言属性描述自动转换为可执行属性,并通过iPBT工具验证,展示了其在提升测试效率和鲁棒性方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏