arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 67%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01644 2026-02-03 cs.LG cs.AI cs.CV cs.MA cs.RO 67%

From Perception to Action: Spatial AI Agents and World Models

从感知到行动:空间AI代理与世界模型

Gloria Felicia, Nolan Bryant, Handi Putra, Ayaan Gazali, Eliel Lobo, Esteban Rojas

机构 * AtlasPro AI

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。

Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12479 2026-01-21 cs.RO 67%

Language-Based Swarm Perception: Decentralized Person Re-Identification via Natural Language Descriptions

基于语言的群体感知:通过自然语言描述实现去中心化的人员重识别

Miquel Kegeleirs, Lorenzo Garattoni, Gianpiero Francesca, Mauro Birattari

机构 * IRIDIA, Université libre de Bruxelles(IRIDIA,布鲁塞尔自由大学) Toyota Motor Europe(丰田欧洲 motors)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种基于自然语言的去中心化人员重识别方法,通过视觉-语言模型生成文本描述,实现群体协作识别与可解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04070 2025-12-19 cs.CL cs.MM 67%

LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward

LaF-GRPO:通过GRPO与LLM-as-Follower生成视障人士的现场导航指令

Yi Zhao, Siqi Wang, Jing Li

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 LaF-GRPO通过GRPO与LLM-as-Follower生成更直观安全的视障人士现场导航指令,提升指令准确性和实用性。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 67%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04356 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment

通过自增强对比对齐缓解多模态大语言模型中的对象和动作幻觉

Kai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SANTA框架通过自增强对比对齐方法,有效缓解多模态大语言模型中的对象和动作幻觉问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Project page: https://kpc0810.github.io/santa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 67%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14004 2025-11-24 cs.RO 67%

Searching in Space and Time: Unified Memory-Action Loops for Open-World Object Retrieval

在空间和时间中搜索:统一的记忆-动作循环用于开放世界物体检索

Taijing Chen, Sateesh Kumar, Junhong Xu, Georgios Pavlakos, Joydeep Biswas, Roberto Martín-Martín

机构 * Department of Computer Science, The University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)

AI总结 STAR框架通过统一记忆查询和具身动作,提升开放世界中时空物体检索的效率与准确性。

Comments https://amrl.cs.utexas.edu/STAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06182 2025-11-24 cs.RO 67%

OpenVLN: Open-world Aerial Vision-Language Navigation

OpenVLN: 开放世界空中视觉语言导航

Peican Lin, Gan Sun, Chenxi Liu, Fazeng Li, Weihong Ren, Yang Cong

机构 * School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人重点实验室) State Key Laboratory of Robotics and System, School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院机器人与系统重点实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 OpenVLN通过强化学习和长视距规划器提升无人机在复杂空中环境中的长视距导航能力。

Comments Content: 8 pages 4 figures, conference paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19002 2025-11-18 cs.CV cs.AI cs.CL cs.LG 67%

VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction

Hao Wang, Eiki Murata, Lingfang Zhang, Ayako Sato, So Fukuda, Ziqi Yin, Wentao Hu, Keisuke Nakao, Yusuke Nakamura, Sebastian Zwirner, Yi-Chia Chen, Hiroyuki Otomo, Hiroki Ouchi, Daisuke Kawahara

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(CyberAgent公司) AI Shift, Inc.(AI Shift公司) Nara Institute of Science and Technology(奈良研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25122 2025-10-30 cs.RO 67%

NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies

Jiahong Chen, Jing Wang, Long Chen, Chuwei Cai, Jinghui Lu

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Alberta(阿尔伯塔大学) Xiaomi EV(小米电动车) Northeastern University(东北大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24949 2025-10-30 cs.RO cs.AI cs.CV cs.LG 67%

SCOUT: A Lightweight Framework for Scenario Coverage Assessment in Autonomous Driving

Anil Yildiz, Sarah M. Thornton, Carl Hildebrandt, Sreeja Roy-Singh, Mykel J. Kochenderfer

机构 * Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Nuro Inc.(Nuro公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11717 2025-10-20 cs.LG cs.AI cs.CL cs.CV 67%

WebInject: Prompt Injection Attack to Web Agents

Xilong Wang, John Bloch, Zedian Shao, Yuepeng Hu, Shuyan Zhou, Neil Zhenqiang Gong

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11886 2025-10-15 cs.RO 67%

Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation

Shuo Wang, Yongcai Wang, Wanting Li, Xudong Cai, Yucheng Wang, Maiyue Chen, Kaihui Wang, Zhizhong Su, Deying Li, Zhaoxin Fan

机构 * Renmin University of China(中国人民大学) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Horizon Robotics(地平线机器人)

专题命中 GUI与屏幕智能体 :visual question answering(abstract);grounding(abstract)

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09038 2025-10-13 cs.AI cs.CL cs.CV cs.CY cs.LG 67%

Auto-scaling Continuous Memory for GUI Agent

Wenyi Wu, Kun Zhou, Ruoxin Yuan, Vivian Yu, Stephen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Fudan University(复旦大学) Abel AI

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20711 2025-10-13 cs.HC cs.RO 67%

Automating eHMI Action Design with LLMs for Automated Vehicle Communication

Ding Xia, Xinyue Gui, Fan Gao, Dongyuan Li, Mark Colley, Takeo Igarashi

机构 * The University of Tokyo(东京大学) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

Comments Accepted as findings for EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07077 2025-10-09 cs.RO cs.AI cs.CV cs.LG 67%

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to IEEE Access, website: https://vla-survey.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23655 2025-09-30 cs.RO cs.AI cs.CV cs.LG 67%

Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models

Rokas Bendikas, Daniel Dijkman, Markus Peschl, Sanjay Haresh, Pietro Mazzaglia

机构 * Centre for Artificial Intelligence, UCL(人工智能中心,伦敦大学学院) Qualcomm AI Research(高通人工智能研究)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Presented at 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23563 2025-09-30 cs.RO cs.AI cs.CV cs.LG 67%

RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation

Seungchan Kim, Omar Alama, Dmytro Kurdydyk, John Keller, Nikhil Keetha, Wenshan Wang, Yonatan Bisk, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Davidson College(戴维森学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17144 2025-09-30 cs.CV cs.AI cs.LG 67%

Do We Need Large VLMs for Spotting Soccer Actions?

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Avijit Dasgupta, Sandeep Chaurasia

机构 * Manipal University Jaipur(贾浦尔曼普尔大学) UNC–Charlotte(北卡罗来纳州立大学夏洛特分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 6 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17941 2025-09-23 cs.RO cs.AI cs.CV cs.LG 67%

ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion

Zichao Hu, Chen Tang, Michael J. Munje, Yifeng Zhu, Alex Liu, Shuijing Liu, Garrett Warnell, Peter Stone, Joydeep Biswas

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) Army Research Laboratory(陆军研究实验室) Sony AI(索尼人工智能)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Conference on Robot Learning (CoRL) 2025 Project site: https://amrl.cs.utexas.edu/ComposableNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08283 2025-09-23 cs.IR 67%

Serendipitous Recommendation with Multimodal LLM

Haoting Wang, Jianling Wang, Hao Li, Fangjun Yi, Mengyu Fu, Youwei Zhang, Yifan Liu, Liang Liu, Minmin Chen, Ed H. Chi, Lichan Hong, Haokai Lu

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

Comments Accepted by 2025 Recsys EARL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14889 2025-09-19 cs.RO 67%

CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human

Nan Sun, Yongchang Li, Chenxu Wang, Huiying Li, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06937 2025-09-19 cs.RO 67%

Handle Object Navigation as Weighted Traveling Repairman Problem

Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

机构 * Centre for Advanced Robotics Technology Innovation (CARTIN), School of Electrical and Electronic Engineering, Nanyang Technological University(先进机器人技术创新中心(CARTIN)、电子与电气工程学院、南洋理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11417 2025-09-18 cs.RO cs.AI cs.CV cs.LG 67%

Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations

Shresth Grover, Akshay Gopalkrishnan, Bo Ai, Henrik I. Christensen, Hao Su, Xuanlin Li

机构 * UC San Diego(圣迭戈大学) Hillbot

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Page: https://gen-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02544 2025-09-08 cs.CL 67%

Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions

Xinbei Ma, Yiting Wang, Yao Yao, Tongxin Yuan, Aston Zhang, Zhuosheng Zhang, Hai Zhao

机构 * School of Computer Science(计算机学院) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering(智能交互与认知工程重点实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(Web3可信数据流通与治理上海市重点实验室) GenAI, Meta(Meta GenAI)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01658 2025-09-03 cs.RO 67%

MoTo: A Zero-shot Plug-in Interaction-aware Navigation for General Mobile Manipulation

Zhenyu Wu, Angyuan Ma, Xiuwei Xu, Hang Yin, Yinan Liang, Ziwei Wang, Jiwen Lu, Haibin Yan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

Comments Accepted to CoRL 2025. Project Page: https://gary3410.github.io/MoTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09071 2025-08-14 cs.RO 67%

GeoVLA: Empowering 3D Representations in Vision-Language-Action Models

Lin Sun, Bin Xie, Yingfei Liu, Hao Shi, Tiancai Wang, Jiale Cao

机构 * Tianjin University(天津大学) Dexmal Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

Comments The project is visible at https://linsun449.github.io/GeoVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04700 2025-08-13 cs.AI cs.CL cs.CV cs.LG cs.MA cs.MM 67%

SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience

Zeyi Sun, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Tong Wu, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code at https://github.com/SunzeY/SEAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06441 2025-07-10 eess.SY cs.RO cs.SY 67%

VisioPath: Vision-Language Enhanced Model Predictive Control for Safe Autonomous Navigation in Mixed Traffic

Shanting Wang, Panagiotis Typaldos, Chenjun Li, Andreas A. Malikopoulos

机构 * System Engineering Program, Cornell University(Cornell大学系统工程项目) School of Civil and Environmental Engineering, Cornell University(Cornell大学土木与环境工程学院) School of Electrical and Computer Engineering, Cornell University(Cornell大学电气与计算机工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏