arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-22 至 2026-05-22 共收录 79 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 27 篇

2605.21747 2026-05-22 cs.CV cs.RO 85%

Improving 3D Labeling in Self-Driving by Inferring Vehicle Information using Vision Language Models

通过利用视觉语言模型推断车辆信息以改进自动驾驶中的3D标注

Steven Chen, Shivesh Khaitan, Nemanja Djuric

机构 * Aurora Innovation, Inc.(Aurora创新公司)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种利用视觉语言模型推断车辆信息以提高自动驾驶中3D车辆标注精度的方法,通过零样本推理车辆信息,结合车辆型号和型号识别方法,提升了标注效率和质量。

Comments To appear in Proceedings of the IEEE Intelligent Vehicles Symposium (IV), 2026. Accepted for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21796 2026-05-22 cs.CV cs.CL 84%

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

MM-Conv: 一种多模态数据集和基准,用于上下文感知的3D对话中指代解析

Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan, Lubos Marcinek, Anna Klezovich, Iolanda Leite, Jonas Beskow

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV;VLM(comments)

AI总结 本文提出了一种多模态数据集和基准,用于在动态3D环境中实现上下文感知的指代解析,通过引入包含6.7小时第一人称VR交互的同步语音、动作、注视和3D场景几何数据的基准,以及一个两阶段的指代解析流水线,改进了对话中的指代解析性能。

Comments Extended version of the paper published at LREC 2026 (Palma de Mallorca, Spain), with expanded VLM baselines and inter-annotator agreement analysis

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22581 2026-05-22 cs.CV cs.AI cs.LG 83%

SceneAligner: 3D-Grounded Floorplan Localization in the Wild

SceneAligner: 在真实场景中实现基于3D的平面定位

Junhyeong Cho, Ruojin Cai, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) Kempner Institute, Harvard University(哈佛大学 Kempner 院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种在真实场景中实现基于3D重建的平面定位方法,通过将任务 grounding 在场景的重建3D表示中,解决了现有方法在大规模建筑和栅格化平面图中应用受限的问题。

Comments Project Page: https://Cornell-VAILab.github.io/SceneAligner

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 82%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01851 2026-05-22 cs.CV 81%

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL 81%

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22619 2026-05-22 cs.CV 79%

GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT

GLeVE: 在3D CT中基于图的病变接地与提案验证

Shuo Jiang, Yuhao Hong, Chunbo Jiang, Weihong Chen, Huangwei Chen, Shenghao Zhu, Beining Wu, Mingxuan Liu, Zhu Zhu, Feiwei Qin, Min Tan, Yifei Chen

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Children's Hospital, Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GLeVE框架,通过图引导的病变接地和解剖学先验验证,解决3D CT中自由文本叙述与体积解剖之间的语义-空间差距问题,提升病变定位的准确性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21973 2026-05-22 cs.CV 79%

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地

Zelin Zheng, Xinyan Liu, Ruixin Li, Antoni B. Chan, Guorong Li, Qingming Huang, Laiyun Qing

机构 * Qwen3-VL-8B-Instruct

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22217 2026-05-22 cs.LG cs.CL 74%

Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

生存或崩溃:自我博弈强化学习中数据门控与奖励基础的不对称作用

Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Cisco Research(思科研究)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 本文研究了自我博弈强化学习中数据门控和奖励基础的不对称作用,发现数据门控是维持稳定的关键因素,而奖励信号在门控移除后无法单独保证稳定性,揭示了'基础提出者悖论'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16076 2026-05-22 cs.LG cs.AI cs.NE 73%

Prototype-Grounded Concept Models for Verifiable Concept Alignment

基于原型的可验证概念模型用于可验证的概念对齐

Stefano Colamonaco, David Debot, Pietro Barbiero, Giuseppe Marra

机构 * Department of Computer Science, KU Leuven(卢森堡大学计算机科学系) IBM Research, Zurich(苏黎世IBM研究院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出了一种基于原型的概念模型(PGCMs),通过将概念与学习到的视觉原型关联起来,从而提高概念对齐的可验证性和可解释性,同时保持预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10696 2026-05-22 cs.RO 71%

VRA: Grounding Discrete-Time Joint Acceleration in Voltage-Constrained Actuation

VRA:在电压受限致动器中接地离散时间联合加速度

Lingwei Zhang, Jiaming Wang, Tianlin Zhang, Zhitao Song, Xuanqi Zeng, Weipeng Xia, Zhongyu Li, Yun-hui Liu

机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。

Comments 10 pages, Accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22068 2026-05-22 cs.CV 70%

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

COCOTree: 一个用于开放树状视觉分解的数据集和基准

Junhyub Lee, Seunghun Chae, Hyosu Kim

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22158 2026-05-22 cs.AI cs.CV 62%

ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

ST-SimDiff:平衡时空相似性与差异以实现高效的视频理解与大语言模型

Bingjun Luo, Tony Wang, Chaoqi Chen, Xinpeng Ding

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Xidian University(西安电子科技大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ST-SimDiff框架,通过平衡时空相似性与差异来提高视频理解效率,利用时空图和双选择策略减少计算成本并提升性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21273 2026-05-22 cs.CV 57%

DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

DriveMA: 重新思考驾驶VLAs中的语言接口以单步元动作

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出DriveMA,通过单步元动作替代传统的自然语言推理,解决了驾驶VLAs中语言接口的三个瓶颈问题,实现了更高效的端到端规划。

Comments We withdraw this submission because the current version contains a mismatch between the paper title, conceptual framing, and the intended contribution of the work. To avoid potential misunderstanding by readers, the authors have decided to withdraw this version and substantially revise the title, organization, and presentation before any future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28177 2026-05-22 cs.CV cs.CY 57%

AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images

AEGIS:一个评估人工智能生成学术图像取证分析的综合基准

Bo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27355 2026-05-22 cs.AI cs.CL cs.SE 57%

LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications

LLM Readiness Harness: 评估、可观测性和持续集成门禁用于LLM/RAG应用

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种LLM和RAG应用的准备性框架,通过自动化基准测试、OpenTelemetry可观测性和持续集成质量门禁,将评估转化为部署决策流程,并通过帕累托前沿计算场景加权的准备度分数,展示了在票务路由工作流和BEIR接地任务上的评估结果。

Comments 19 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04537 2026-05-22 cs.LG cs.CL 57%

Linear Dynamics in the RLVR Training of Large Language Models

在大语言模型RLVR训练中的线性动力学

Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc. Beihang University(北航大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)在大语言模型训练中的内部动态,发现RLVR在多种模型和训练配置下均进入线性区域,通过实验和理论分析证明这种线性特性源于训练信号的高方差和噪声,且具有预测性和实用性。

Comments Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08380 2026-05-22 cs.SE cs.AI 57%

What Software Engineering Looks Like to AI Agents? -- An Empirical Study of AI-Only Technical Discourse on MoltBook

AI代理如何看待软件工程?-- 对MoltBook上纯AI技术讨论的实证研究

Junyu Huo, Ziqi Mao, Zihao Wan, Gouri Ginde

机构 * University of Calgary(卡尔加里大学) Phanvic

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究通过分析MoltBook上纯AI代理生成的技术讨论,探讨了AI代理在自主交互中产生的 discourse 特点,发现其讨论内容更侧重于安全与信任、内存管理、工具和API、调试与错误处理等主题,但缺乏人类开发者讨论中常见的具体项目细节和运行时信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03674 2026-05-22 cs.CL cs.AI 57%

STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking

STRUCTSENSE:一种任务无关的代理框架,用于结构化信息提取,具有人机协同评估和基准测试

Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, Cambridge, MA, USA(麦戈文脑科学研究所,麻省理工学院,马萨诸塞州剑桥市) Fylo Labs Inc., New York, NY, USA(Fylo实验室公司,纽约州纽约市) Allen Institute for Brain Science, Seattle, WA, USA(艾伦脑科学研究所,华盛顿州西雅图市)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出STRUCTSENSE框架,通过整合本体引导的符号知识、代理自我评估细化和人机协同验证,实现了结构化信息提取的鲁棒性,并在三个领域展示了其跨任务泛化能力。

Comments -

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22027 2026-05-22 cs.CR 50%

Parser-Free Querying of Security Logs

无解析器的日志查询

Evan Luo, Julien Piet, David Wagner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Sieve系统,通过将大型语言模型与轻量级自动提取的日志格式上下文相结合,生成可执行的查询代码,从而在无需解析器的情况下实现安全日志的高效查询,显著降低了复杂时间序列和跨事件查询的错误率。

Comments 21 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21816 2026-05-22 cs.CY 50%

Barriers to Evidence in AI-Related Cases and the Privatization of Proof

人工智能相关案件中的证据障碍与证明的私有化

Sarah H. Cen, Hannah Ismael, Lucia Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了人工智能相关案件中证据获取的障碍,探讨了由于访问权、资源和专业知识的不对称性导致的证明私有化问题,并提出了一种解决AI访问争议的三步测试法。

Comments 42 pages, 0 figures, 1 table, The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21690 2026-05-22 cs.SE 50%

The 2nd Workshop on Agile Practice & Research: A Summary and Call For Research

第二届敏捷实践与研究研讨会:总结与研究呼吁

Karen Eilers, Michael Neumann, Eva-Maria Schön, Mali Senapathi, Maria Rauschenberger, Tiago Silva da Silva

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文总结了第二届敏捷实践与研究研讨会,探讨了理论、时间与转移三个研究与实践之间的差距,并提出了加强研究与实践协作的三个研究呼吁。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2605.00392 2026-05-22 cs.CV cs.LG 62%

RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

RTPrune: 两次阅读启发的令牌修剪用于高效DeepSeek-OCR推理

Ben Wan, Yan Feng, Zihan Tang, Weizhe Huang, Yuting Zeng, Jia Wang, Tongxuan Liu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出RTPrune,一种针对DeepSeek-OCR的两次阶段令牌修剪方法,通过优先保留高范数视觉令牌并利用最优传输理论进行令牌配对和合并,从而在OCR任务中实现更高效的推理性能和更优的效率-精度权衡。

Comments 21 pages, accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 5 篇

2605.20246 2026-05-22 cs.LG cs.AI 89%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22812 2026-05-22 cs.RO cs.CV 84%

GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

GesVLA: 一种具有手势感知能力的视觉-语言-动作模型嵌入表示

Wenxuan Guo, Ziyuan Li, Meng Zhang, Yichen Liu, Yimeng Dong, Chuxi Xu, Yunfei Wei, Ze Chen, Erjin Zhou, Jianjiang Feng

机构 * Tsinghua University(清华大学) Dexmal

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出GesVLA模型,通过引入手势作为平行指令模态,解决现有VLA系统在复杂场景中空间模糊问题,采用双VLM架构实现手势表示与动作策略的紧密耦合,并通过手势数据生成管道和两阶段训练策略提升目标定位准确性和人机交互效率。

Comments Project page: https://gwxuan.github.io/GesVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22036 2026-05-22 cs.CV cs.AI 79%

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示

Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robbyant School of Computing, National University of Singapore(新加坡国立大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22816 2026-05-22 cs.RO cs.CV 57%

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05765 2026-05-22 cs.CV 57%

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 4 篇

2605.22185 2026-05-22 cs.CV cs.LG 86%

Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

增强多模态大语言模型以用于安全关键驾驶视频分析

Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo Taccari

机构 * Verizon Connect

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本研究通过融合降采样视频帧与同步高频 telemetry 数据及专用计算机视觉模型的语义信息,提升多模态大语言模型在安全关键驾驶场景中的感知与推理能力,从而更准确地识别和描述现实驾驶中的安全关键事件。

Comments Accepted at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 77%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.LG

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏