arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-22 至 2026-05-22 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2605.22446 2026-05-22 cs.CV cs.AI cs.RO 93%

Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

Pre-VLA: 预防性运行时验证用于可靠视觉-语言-动作和世界模型展开

Zhen Sun, Yongjian Guo, Haoran Sun, Luqiao Wang, Wei Lu, Jiachi Ji, Shengzhe Ji, Junwu Xiong, Zhijun Meng

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Pre-VLA,一种统一的运行时验证架构,用于在物理执行或世界模型想象之前评估动作的有效性,以提高视觉-语言-动作和世界模型展开的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22812 2026-05-22 cs.RO cs.CV 92%

GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

GesVLA: 一种具有手势感知能力的视觉-语言-动作模型嵌入表示

Wenxuan Guo, Ziyuan Li, Meng Zhang, Yichen Liu, Yimeng Dong, Chuxi Xu, Yunfei Wei, Ze Chen, Erjin Zhou, Jianjiang Feng

机构 * Tsinghua University(清华大学) Dexmal

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出GesVLA模型,通过引入手势作为平行指令模态,解决现有VLA系统在复杂场景中空间模糊问题,采用双VLM架构实现手势表示与动作策略的紧密耦合,并通过手势数据生成管道和两阶段训练策略提升目标定位准确性和人机交互效率。

Comments Project page: https://gwxuan.github.io/GesVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22089 2026-05-22 cs.CV cs.AI 86%

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22283 2026-05-22 cs.RO 85%

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

视觉-语言-动作中视界外操作的空间记忆

Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science(人工智能推动部,香港科学大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出SOMA框架,用于解决视觉-语言-动作模型中视界外操作的问题,通过构建持久的空间记忆,使模型能够超越当前视觉范围进行推理,提升任务成功率和操作行为质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22322 2026-05-22 cs.RO 77%

How can reasoning capability empower the AI copilot robot in endoscopic surgery

推理能力如何赋能内窥手术中的AI助手机器人

Guankun Wang, Long Bai, Hongliang Ren

机构 * Department of Electronic Engineering(电子工程系)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文研究了推理能力在内窥手术中AI助手机器人中的应用,提出通过整合多模态线索、解读手术意图和推断隐藏组织动态来提高手术的精确性、安全性和可持续性。

Comments Accepted by npj digital medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20246 2026-05-22 cs.LG cs.AI 76%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21273 2026-05-22 cs.CV 70%

DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

DriveMA: 重新思考驾驶VLAs中的语言接口以单步元动作

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang zhao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出DriveMA,通过单步元动作替代传统的自然语言推理,解决了驾驶VLAs中语言接口的三个瓶颈问题,实现了更高效的端到端规划。

Comments We withdraw this submission because the current version contains a mismatch between the paper title, conceptual framing, and the intended contribution of the work. To avoid potential misunderstanding by readers, the authors have decided to withdraw this version and substantially revise the title, organization, and presentation before any future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22617 2026-05-22 astro-ph.SR astro-ph.HE 67%

Search for radio polarization in the particle-accelerating colliding-wind binaries WR 147 and HD 167971

在粒子加速碰撞风双星WR 147和HD 167971中寻找无线电偏振

A. B. Blanco, M. De Becker, P. Benaglia, S. del Palacio

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文研究了在WR 147和HD 167971这两个粒子加速碰撞风双星中检测无线电偏振辐射的极化特性,并探讨了这些源的物理机制。

Comments Accepted for publication in Astronomy & Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22163 2026-05-22 astro-ph.GA astro-ph.IM 67%

A Unified H i Rotation Curve Database for 129 Local Volume Dwarf and Irregular Galaxies

为129个本地体积矮星系和不规则星系构建的统一HI旋转曲线数据库

David C. Flynn

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文提出一个统一的HI旋转曲线数据库,用于129个本地体积中的矮星系和不规则星系,通过四个调查整合数据,提供标准化的运动学参数、距离估计、形态分类和旋转曲线数据,支持检索增强生成和跨调查运动学分析。

Comments 6 pages, 1 figure, 1 table. Data and code at Zenodo: https://doi.org/10.5281/zenodo.20320362

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22243 2026-05-22 cs.LG cs.AI stat.AP 62%

Explainable AI for Data-Driven Design of High-Dimensional Predictive Studies

为高维预测研究的数据驱动设计开发可解释的AI

Junyu Yan, Damian Machlanski, Kurt Butler, Panagiotis Dimitrakopoulos, Ewen M Harrison, Bruce Guthrie, Sotirios A Tsaftaris

机构 * School of Engineering, University of Edinburgh(爱丁堡大学工程学院) Causality in Healthcare AI Hub (CHAI)(医疗因果AI枢纽) Advanced Care Research Centre, Usher School of Population Health Sciences, University of Edinburgh(先进护理研究中心,乌瑟人口健康科学学院,爱丁堡大学) Centre for Medical Informatics, Usher School of Population Health Sciences, University of Edinburgh(医学信息学中心,乌瑟人口健康科学学院,爱丁堡大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可解释的AI推荐系统,通过数据驱动的方法改进现有可解释统计模型的预测性能,主要贡献是通过可解释AI技术提供三种推荐类型以提高模型的预测能力和透明度。

Comments 41 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22126 2026-05-22 cs.CV 57%

AesFormer: Transform Everyday Photos into Beautiful Memories

AesFormer: 将日常照片转化为美丽的记忆

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出AesFormer框架,通过将审美规划与图像编辑解耦,改进照片的审美质量,同时保持主体身份和场景语义,构建了包含9071对严格对齐图像对的AesRecon基准数据集。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21853 2026-05-22 cs.IR cs.LG 57%

LEMUR: Learned Multi-Vector Retrieval

LEMUR: 学习多向量检索

Elias Jääsaari, Ville Hyvönen, Teemu Roos

机构 * Department of Computer Science, University of Helsinki, Helsinki, Finland(赫尔辛基大学计算机科学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 LEMUR通过将多向量相似性搜索转化为监督学习问题,并利用现有单向量搜索索引加速检索,实现了高效的多向量相似性搜索,比现有方法快一个数量级。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15754 2026-05-22 astro-ph.HE hep-ph 50%

Single-source-class interpretation of the diffuse astrophysical neutrino flux

单源类解释弥漫天体中微子通量

Walter Winter, Damiano F. G. Fiorillo, Sara Buson

专题命中 VLA模型 :action model(abstract)

AI总结 本研究探讨了弥漫天体中微子通量主要由单一标准烛光源类主导的解释,通过分析光子与质子相互作用模型,预测了中微子能量上限受多种因素限制,并指出未来中微子味组成或中微子-反中微子比值测量可能区分不同场景。

Comments Version accepted for publication in PRD including several clarifications. 19 pages, 9 figures, 1 table. Data can be retrieved at https://zenodo.org/records/19820788

详情

展开后加载摘要…

URL PDF HTML 收藏