arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-28 至 2026-04-28 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 10 篇

2508.19679 2026-04-28 cs.AI 89%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23941 2026-04-28 cs.CV 87%

GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction

GoClick:轻量级元素接地模型用于自主GUI交互

Hongxin Li, Yuntao Chen, Zhaoxiang Zhang

机构 * 1 University of Chinese Academy of Sciences, Beijing, China. 2 New Laboratory of Pattern Recognition, State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China. 3 Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences, Hong Kong, China. Zhaoxiang Zhang

专题命中 GUI与屏幕智能体 :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出GoClick,一种轻量级GUI元素接地模型,通过改进架构和数据精炼流程,在保持高精度的同时降低参数规模,适用于资源受限设备的低延迟GUI交互任务。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24441 2026-04-28 cs.CV 81%

AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

AutoGUI-v2:一个全面的多模态GUI功能理解基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Hong Kong Institute of Science & Innovation(香港科学创新研究院) PolyU Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 79%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 75%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI 70%

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 70%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 70%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17736 2026-04-28 cs.HC cs.AI 57%

From Static to Interactive: Authoring Interactive Visualizations via Natural Language

从静态到交互:通过自然语言实现交互式可视化

Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) Ajou University(阿乔大学) Providence Health & Services(普罗维登斯健康与服务)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Athanor方法,利用多模态大语言模型和自然语言指令将静态可视化转为交互式,通过三种创新设计提升用户交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏