arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2604.17190 2026-04-21 cs.CV 81%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17915 2026-04-21 cs.CV 77%

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17284 2026-04-21 cs.AI 77%

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

HalluClear:诊断、评估和缓解GUI代理中的幻觉

Chao Jin, Wenkui Yang, Hao Sun, Yuqi Liao, Qianyi Jiang, Kai Zhou, Jie Cao, Ran He, Huaibo Huang

机构 * MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所人工智能与自然语言处理实验室,中国科学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Meituan(美团)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 HalluClear通过引入专门的幻觉分类、校准的评估流程和闭环推理方案,有效减少GUI代理中的幻觉,提升自动化可靠性。

Comments 47 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02972 2026-04-21 cs.CV cs.RO 77%

TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation

TagaVLM:面向视觉语言导航的拓扑感知全局动作推理

Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu, Baocai Yin

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) Imperial College London, U.K.(伦敦帝国理工学院,英国)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 TagaVLM通过引入拓扑结构增强视觉语言模型,提升空间推理能力,在R2R基准中取得最佳性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 74%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);分类 cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10533 2026-04-21 cs.RO cs.CL cs.CV 70%

VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions

VLN-NF:具有假前提指令的视图与语言导航

Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) National Tsing Hua University(国立清华大学) DRIC

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VLN-NF基准,通过引入假前提指令,要求智能体在目标不存在时进行探索并明确输出NOT-FOUND,采用ROAM方法在房间级导航与室内探索中取得最佳性能。

Comments ACL 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18223 2026-04-21 cs.CV 57%

Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation

指令作为状态:环境引导和状态条件的语义理解用于具身导航

Zhen Liu, Yuhan Liu, Jinjun Wang, Jianyi Liu, Wei Song, Jingwen Fu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) The Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) School of Information Science and Technology(信息科学与技术学院) Zhongguancun Academy(中关村学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种环境引导和状态条件的语义理解方法,通过动态指令-感知纠缠提升具身导航性能,实验表明在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00789 2026-04-21 cs.CV 57%

CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving

CogDriver:通过整合认知惯性实现自动驾驶中的时间一致规划

Pei Liu, Qingtian Ning, Xinyan Lu, Haipeng Liu, Weiliang Ma, Dangen She, Peng Jia, Xianpeng Lang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Li Auto Inc.(利汽车公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CogDriver框架,通过引入认知惯性提升自动驾驶中的时间一致性规划能力,通过大规模视觉-语言-动作数据集和稀疏时间记忆架构,显著提升了闭环驾驶得分和模仿准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16384 2026-04-21 cs.RO cs.CY 50%

RHINO-AR: An Augmented Reality Exhibit for Teaching Mobile Robotics Concepts in Museums

RHINO-AR:一种用于博物馆中教学移动机器人概念的增强现实展览

Nils Dengler, Tim Graf, Leif Van Holland, Patrick Stotko, Reinhard Klein, Maren Bennewitz

机构 * Humanoid Robots Lab, University of Bonn, Germany(波恩大学人形机器人实验室,德国)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 RHINO-AR通过将虚拟重建的机器人置于真实博物馆空间,解决了VR展览与现实环境分离的问题,提升了非专业观众对移动机器人导航概念的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏