arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2511.22697 2025-12-01 cs.RO cs.CL cs.CV 57%

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21398 2025-11-27 cs.AI cs.CL cs.HC cs.MA 57%

Prune4Web: DOM Tree Pruning Programming for Web Agent

Prune4Web: 面向Web代理的DOM树剪枝编程

Jiayuan Zhang, Kaiquan Chen, Zhihao Lu, Enshen Zhou, Qian Yu, Jing Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21202 2025-11-27 cs.CV 57%

Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition

迈向细粒度视频动作识别的有效动作-区域跟踪框架

Baoli Sun, Yihan Wang, Xinzhu Ma, Zhihui Wang, Kun Lu, Zhiyong Wang

机构 * DUT-RU International School of Information Science & Engineering, Dalian University of Technology, China(大连理工大学国际信息科学与工程学院,大连理工大学,中国) Beihang University, China(北京航空航天大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

AI总结 本文提出了一种动作-区域跟踪框架,通过查询-响应机制捕捉细粒度动作细节,提升视频动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11127 2025-11-27 cs.CL cs.AI 57%

UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions

UITron-Speech: 向基于语音指令的自动化GUI代理迈进

Wenkang Han, Zhixiong Zeng, Jing Huang, Shu Jiang, Liming Zheng, Longrong Yang, Haibo Qiu, Chang Yao, Jingyuan Chen, Lin Ma

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 57%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV 57%

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16048 2025-11-21 cs.RO cs.AI cs.HC 57%

Semantic Glitch: Agency and Artistry in an Autonomous Pixel Cloud

语义裂隙:自主像素云中的代理与艺术性

Qing Zhang, Jing Huang, Mingyang Xu, Jun Rekimoto

机构 * The University of Tokyo(东京大学) Tokyo University of the Arts(东京艺术大学) Keio University(庆应大学) SONY CSL Kyoto(索尼 CSL 京都)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出语义裂隙,通过多模态大语言模型实现自主导航,展示低 fidelity方法在创造不完美但富有艺术性的机器人同伴中的应用。

Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23596 2025-11-20 cs.AI 57%

Agent-SAMA: State-Aware Mobile Assistant

Linqiang Guo, Wei Liu, Yi Wen Heng, Tse-Hsun, Chen, Yang Wang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12405 2025-11-18 cs.CV 57%

VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving

Hyunki Seong, Seongwoo Moon, Hojin Ahn, Jehun Kang, David Hyunchul Shim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04614 2025-11-18 cs.AI 57%

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Yuyang Wanyan, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Jiabo Ye, Yutong Kou, Ming Yan, Fei Huang, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20900 2025-11-18 cs.RO cs.AI 57%

DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping

Yifan Zhong, Xuchuan Huang, Ruochong Li, Ceyao Zhang, Zhang Chen, Tianrui Guan, Fanlian Zeng, Ka Num Lui, Yuyao Ye, Yitao Liang, Yaodong Yang, Yuanpei Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10615 2025-11-14 cs.CV cs.CL 57%

Towards Blind and Low-Vision Accessibility of Lightweight VLMs and Custom LLM-Evals

Shruti Singh Baghel, Yash Pratap Singh Rathore, Sushovan Jena, Anurag Pradhan, Amit Shukla, Arnav Bhavsar, Pawan Goyal

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) Vellore Institute of Technology(韦洛雷理工学院) Indian Institute of Technology Kharagpur(印度理工学院哈里科普分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08892 2025-11-13 cs.AI 57%

Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds

Weihao Tan, Xiangyang Li, Yunhao Fang, Heyuan Yao, Shi Yan, Hao Luo, Tenglong Ao, Huihui Li, Hongbin Ren, Bairen Yi, Yujia Qin, Bo An, Libin Liu, Guang Shi

机构 * ByteDance Seed(字节跳动种子) NTU(国立科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06840 2025-11-11 cs.CV cs.RO 57%

PanoNav: Mapless Zero-Shot Object Navigation with Panoramic Scene Parsing and Dynamic Memory

Qunchao Jin, Yilin Wu, Changhao Chen

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted as a poster in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04307 2025-11-11 cs.AI 57%

GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents

Jian Mu, Chaoyun Zhang, Chiming Ni, Lu Wang, Bo Qiao, Kartik Mathur, Qianhui Wu, Yuhang Xie, Xiaojun Ma, Mengyu Zhou, Si Qin, Liqun Li, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Nanjing University(南京大学) Microsoft(微软) ZJU-UIUC(浙大-UIUC) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19012 2025-11-11 cs.RO cs.AI 57%

Pure Vision Language Action (VLA) Models: A Comprehensive Survey

Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou

机构 * Lanzhou University, China(兰州大学) National University of Singapore, Singapore(新加坡国立大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06251 2025-11-11 cs.SE cs.AI 57%

WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation

Mingde Xu, Zhen Yang, Wenyi Hong, Lihang Pan, Xinyue Fan, Yan Wang, Xiaotao Gu, Bin Xu, Jie Tang

机构 * Faculty of Mathematics, University of Waterloo(滑铁卢大学数学系) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程集团) Zhipu AI(智谱AI)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments 36 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03497 2025-11-06 cs.RO cs.AI cs.SE 57%

ROSBag MCP Server: Analyzing Robot Data with LLMs for Agentic Embodied AI Applications

Lei Fu, Sahar Salimpour, Leonardo Militano, Harry Edelman, Jorge Peña Queralta, Giovanni Toffetti

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13174 2025-11-06 cs.CV 57%

Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models

Hao Cheng, Erjia Xiao, Yichi Wang, Chengyuan Yu, Mengshu Sun, Qiang Zhang, Jiahang Cao, Yijie Guo, Ning Liu, Kaidi Xu, Jize Zhang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) Beijing University of Technology(北京理工大学) Duke University(杜克大学) X-Humanoid Project(X-Humanoid 项目)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27255 2025-11-04 cs.CV 57%

Enhancing Spatio-Temporal Zero-shot Action Recognition with Language-driven Description Attributes

Yehna Kim, Young-Eun Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00933 2025-11-04 cs.RO cs.CV 57%

Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation

Xiangyu Shi, Zerui Li, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, the University of Adelaide(澳大利亚机器学习研究所、阿德莱德大学) CREATE Lab, Swiss Federal Institute of Technology Lausanne (EPFL)(洛桑联邦理工学院CREATE实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23763 2025-11-04 cs.RO cs.CL cs.CV 57%

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Siyin Wang, Jinlan Fu, Feihong Liu, Xinzhe He, Huangxuan Wu, Junhao Shi, Kexin Huang, Zhaoye Fei, Jingjing Gong, Zuxuan Wu, Yu-Gang Jiang, See-Kiong Ng, Tat-Seng Chua, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25668 2025-10-30 cs.AI cs.MM 57%

ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents

Tianyu Yang, Terry Ruas, Yijun Tian, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

机构 * University of Göttingen(戈丁根大学) University of Notre Dame(诺特大学) State and University Library of Göttingen(戈丁根州立大学图书馆)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22917 2025-10-29 cs.RO cs.AI 57%

HyPerNav: Hybrid Perception for Object-Oriented Navigation in Unknown Environment

Zecheng Yin, Hao Zhao, Zhen Li

机构 * Future Network of Intelligence Institute(Shenzhen)(智能未来网络研究所(深圳)) Tsinghua University(清华大学) The Chinese University of Hongkong(Shenzhen)(香港大学(深圳))

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21809 2025-10-28 cs.CV cs.RO 57%

Embodied Navigation with Auxiliary Task of Action Description Prediction

Haru Kondoh, Asako Kanezaki

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(日本科学技术研究所AIP)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19949 2025-10-27 cs.AI 57%

Surfer 2: The Next Generation of Cross-Platform Computer Use Agents

Mathieu Andreux, Märt Bakler, Yanael Barbier, Hamza Benchekroun, Emilien Biré, Antoine Bonnet, Riaz Bordie, Nathan Bout, Matthias Brunel, Aleix Cambray, Pierre-Louis Cedoz, Antoine Chassang, Gautier Cloix, Ethan Connelly, Alexandra Constantinou, Ramzi De Coster, Hubert de la Jonquiere, Aurélien Delfosse, Maxime Delpit, Alexis Deprez, Augustin Derupti, Mathieu Diaz, Shannon D'Souza, Julie Dujardin, Abai Edmund, Michael Eickenberg, Armand Fatalot, Wissem Felissi, Isaac Herring, Xavier Koegler, Erwan Le Jumeau de Kergaradec, Aurélien Lac, Maxime Langevin, Corentin Lauverjat, Antonio Loison, Avshalom Manevich, Axel Moyal, Axel Nguyen Kerbel, Marinela Parovic, Julien Revelle, Guillaume Richard, Mats Richter, Ronan Riochet, María Santos, Romain Savidan, Laurent Sifre, Maxime Theillard, Marc Thibault, Ivan Valentini, Tony Wu, Laura Yie, Kai Yuan, Jevgenij Zubovskij

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

Comments 21 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06072 2025-10-27 cs.RO cs.LG 57%

BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning

Hongyi Zhou, Weiran Liao, Xi Huang, Yucheng Tang, Fabian Otto, Xiaogang Jia, Xinkai Jiang, Simon Hilber, Ge Li, Qian Wang, Ömer Erdinç Yağmurlu, Nils Blank, Moritz Reuss, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) Robotics Institute Germany(德国机器人研究所) Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 57%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏