arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2405.00145 2024-11-12 cs.SE cs.CV 79%

GUing: A Mobile GUI Search Engine using a Vision-Language Model

Jialiang Wei, Anne-Lise Courbis, Thomas Lambolais, Binbin Xu, Pierre Louis Bernard, Gérard Dray, Walid Maalej

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04603 2024-10-08 cs.CV 79%

AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation

Yuhan Zhu, Yuyang Ji, Zhiyu Zhao, Gangshan Wu, Limin Wang

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14818 2024-10-04 cs.CL cs.AI 79%

MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding

Qinzhuo Wu, Weikai Xu, Wei Liu, Tao Tan, Jianfeng Liu, Ang Li, Jian Luan, Bin Wang, Shuo Shang

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00822 2024-06-18 cs.IR cs.AI 79%

InteraRec: Screenshot Based Recommendations Using Multimodal Large Language Models

Saketh Reddy Karra, Theja Tulabandhula

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10935 2024-02-26 cs.HC cs.AI 79%

SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents

Kanzhi Cheng, Qiushi Sun, Yougang Chu, Fangzhi Xu, Yantao Li, Jianbing Zhang, Zhiyong Wu

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04716 2023-10-10 cs.CV 79%

Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API

Zhizheng Zhang, Wenxuan Xie, Xiaoyi Zhang, Yan Lu

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-10 cs.AI cs.CV cs.RO 新提交 79%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 79%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 79%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29563 2026-07-07 cs.AI cs.CV cs.RO 版本更新 79%

Planning with the Views

通过场景自我探索进行视图规划

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Manling Li

机构 * Northwestern University(西北大学) University of Washington(华盛顿大学) Microsoft(微软) University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ViewSuite基准测试揭示VLM在多步视图规划中的不足,并设计迭代框架通过自我探索和视图图蒸馏将Qwen2.5-VL-7B的交互式视图规划准确率从2.5%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI 79%

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 79%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 79%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22036 2026-05-22 cs.CV cs.AI 79%

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示

Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robbyant School of Computing, National University of Singapore(新加坡国立大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17269 2026-05-21 cs.CV cs.AI 79%

FineVision: Open Data Is All You Need

FineVision: 你只需要开放数据

Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

机构 * Hugging Face Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FineVision,一个包含2400万样本的高质量数据集,通过半自动化流程整合了200多个来源,通过严格的数据清洗和人工审核确保数据质量,训练基于该数据集的模型在广泛评估中表现更优,推动数据驱动的视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17144 2026-05-19 cs.RO cs.AI cs.LG 79%

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16241 2026-05-18 cs.CV cs.AI 79%

Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation

离线语义引导用于高效视觉-语言-动作策略蒸馏

Jin Shi, Brady Zhang, Yishun Lu

机构 * Department of Mechanical Engineering(机械工程系) University College London(伦敦大学学院) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-AD框架,利用视觉-语言模型作为离线语义监督者,将大规模VLA教师模型蒸馏为轻量学生策略,通过高阶语义指导提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13119 2026-05-14 cs.RO cs.AI cs.CV 79%

Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models

面向长周期具身智能体的工具对齐视觉-语言-动作模型

Zixing Lei, Changxing Liu, Yichen Xiong, Minhao Xiong, Yuanzhuo Ding, Zhipeng Zhang, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAs-as-Tools方法,通过高阶视觉语言模型与专用工具协作,提升长周期任务的成功率与调用忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV 79%

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09961 2026-03-11 cs.RO cs.AI cs.CV 79%

BEACON: Language-Conditioned Navigation Affordance Prediction under Occlusion

BEACON: 语言条件下的遮挡区域导航可行性预测

Xinyu Gao, Gang Chen, Javier Alonso-Mora

机构 * Department of Cognitive Robotics (CoR), Delft University of Technology(认知机器人学系(CoR),代尔夫特理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 BEACON通过融合视觉语言模型与深度信息,提升遮挡区域导航可行性预测的准确性。

Comments 8 pages. Project page: https://xin-yu-gao.github.io/beacon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 79%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23762 2025-05-30 cs.AI cs.CL cs.CV 79%

ZeroGUI: Automating Online GUI Learning at Zero Human Cost

Chenyu Yang, Shiqian Su, Shi Liu, Xuan Dong, Yue Yu, Weijie Su, Xuehui Wang, Zhaoyang Liu, Jinguo Zhu, Hao Li, Wenhai Wang, Yu Qiao, Xizhou Zhu, Jifeng Dai

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18967 2025-03-03 cs.CV cs.CL cs.LG 79%

Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms

Zhangheng Li, Keen You, Haotian Zhang, Di Feng, Harsh Agrawal, Xiujun Li, Mohana Prasad Sathya Moorthy, Jeff Nichols, Yinfei Yang, Zhe Gan

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 78%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 78%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19905 2026-04-23 cs.SE 78%

ViBR: Automated Bug Replay from Video-based Reports using Vision-Language Models

ViBR:基于视频报告的自动化Bug回放

Sidong Feng, Dingbang Wang, Nikola Tomic, Tingting Yu, Aldeida Aleti, Chunyang Chen

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract)

AI总结 本文提出ViBR,一种基于视觉-语言模型的自动化Bug回放方法,通过动作边界分割和区域感知的GUI状态比较,实现从GUI视频记录中自动复现Bug,实验表明其复现率达72%。

Comments accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05477 2026-04-09 cs.RO 78%

Trust Through Transparency: Explainable Social Navigation for Autonomous Mobile Robots via Vision-Language Models

通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航

Oluwadamilola Sotomi, Devika Kodi, Aliasghar Arab

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)

AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。

Comments Submitted to IEEE Conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 78%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.CV、cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14622 2026-01-22 cs.RO 78%

Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models

通过视觉语言模型探索社交合规机器人导航的提示设计

Ling Xiao, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract)

AI总结 本文通过设计社交合规的提示策略,提升小型视觉语言模型在机器人导航中的行动准确性,发现与自我竞争的提示设计效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19453 2025-12-23 cs.RO 78%

MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation

MaP-AVR: 一种利用视觉语言模型和检索增强生成的元动作规划器

Zhenglong Guo, Yiming Zhao, Feng Jiang, Heng Jin, Zongbao Feng, Jianbin Zhou, Siyuan Xu

机构 * Li Auto

专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract)

AI总结 MaP-AVR通过元动作规划和检索增强生成技术,提升机器人在复杂环境中的任务规划能力。

Comments 8 pages, 10 figures, This work was completed in December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏