arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-13 至 2026-05-13 共收录 19 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 19 篇

2605.11750 2026-05-13 cs.RO cs.AI cs.CL cs.CV 92%

DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies

DreamAvoid:关键阶段测试时 dreaming 以避免 VLA 策略中的失败

Xianzhe Fan, Yuxiang Lu, Shenyuan Gao, Xiaoyang Wu, Ruihua Han, Manling Li, Hengshuang Zhao

机构 * HKU(香港大学) HKUST(香港理工大学) Northwestern University(西北大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 DreamAvoid 通过关键阶段测试时 dreaming 框架,使 VLA 模型能预测并避免失败,提升任务成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08133 2026-05-13 cs.CV cs.AI 91%

VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving

VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶

Rui Zhao, Haofeng Hu, Zhenhai Gao, Jiaqiao Liu, Gao Fei

机构 * College of Automotive Engineering(汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11809 2026-05-13 cs.AI 91%

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

超越世界坐标动作头:面向视觉-语言-动作模型的运动中心动作框架

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) One Robotics Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.AI

AI总结 本文提出MCF-Proto,一种轻量级动作头,通过运动中心动作框架和原型基动作参数化,提升VLA模型对机器人操作行为的组织与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11114 2026-05-13 cs.RO cs.AI 90%

SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection

SEVO:语义增强的虚拟观察用于通过主动照明和数据导向收集的鲁棒VLA操作

Tianchonghui Fang, Yuan Zhuang, Fei Miao

机构 * School of Computing, University of Connecticut(康奈尔大学计算学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 SEVO通过主动照明和数据导向收集提升跨环境操作鲁棒性,采用三机制改进观察,实现95%和83%的成功率,在新环境中转移率达85%和75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08434 2026-05-13 cs.RO 89%

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

失败前进:面向视觉-语言-动作模型的自适应失败信息学习

Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出AFIL框架,通过利用失败轨迹作为负向指导,提升视觉-语言-动作模型在机器人操作中的鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 89%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10993 2026-05-13 cs.RO 89%

ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

ECHO:面向视觉-语言-动作模型的连续层次记忆

Yanbin Hu, Jin Cui, Jiayi Lu, Ruixuan Yang, Jun Ye, Boran Zhao, Xingyu Chen, Xuguang Lan, Pengju Ren

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室,人工智能与机器人研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ECHO框架,通过连续层次空间提升视觉-语言-动作模型在长周期任务中的表现,实现高效经验检索与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12090 2026-05-13 cs.RO cs.CL cs.CV 89%

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);embodied foundation model(abstract)

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06339 2026-05-13 cs.RO cs.AI 87%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 VLA模型 :vision-language-action(title);action model(title);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12160 2026-05-13 cs.RO cs.AI 84%

Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete

Premover: 通过在指令完成前行动实现快速的视觉-语言-动作控制

Joonha Park, Jiseung Jeong, Taesik Gong

机构 * UNIST(全南大学) The Catholic University of Korea(韩国天主教大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 Premover通过在用户指令完成前进行预计算,减少机器人交互时间,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11383 2026-05-13 cs.RO cs.AI 79%

Vision-Based Hand Shadowing for Robotic Manipulation via Inverse Kinematics

基于视觉的手影法用于机器人操作的逆运动学

Hendrik Chiche, Antoine Jamme, Trevor Rigoberto Martinez, Gabriel Gomes

机构 * OMGrab Inc.(OMGrab公司) University of California, Berkeley(加州大学伯克利分校) Fung Institute for Engineering Leadership(工程领导力基金会)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于单目RGB-D相机的逆运动学映射方法,用于将人类手部动作转化为机器人关节指令,通过实验验证了其在结构化和非结构化环境中的有效性。

Comments v2: accepted at IEEE Access (2026); minor revisions per peer review, added WiLoR occlusion-mitigation experiment, error analysis, EMA ablation, and author photos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 77%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11832 2026-05-13 cs.RO 77%

Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation

基于多视图潜在先验的学习动作流形用于机器人操作

Junjin Xiao, Dongyang Li, Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Feng Xiong, Mu Xu, Xing Wei, Zhiheng Ma, Qing Zhang, Wei-Shi Zheng

机构 * Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(机器智能与先进计算国家重点实验室,教育部,中国) AMap, Alibaba Group(阿里的AMap) Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出利用多视图扩散模型合成潜在新视角,并引入几何引导门控变换器以提升机器人视觉-语言-动作模型的空间感知与操作性能,通过动作流形学习提高动作学习效率,实验证明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11564 2026-05-13 cs.RO 77%

RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning

RIO:灵活的实时机器人输入输出用于跨躯体机器人学习

Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jonathan Francis, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Delft(代尔夫特理工大学) Lavoro AI Bosch Center for AI(博世人工智能中心)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 RIO框架提供灵活的机器人控制和部署组件,支持多种硬件平台和形态,通过开放源代码加速真实机器人学习。

Comments 14 pages, 12 figures, 5 tables. Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11344 2026-05-13 cs.HC 71%

Making Abstraction Concrete: A Design Space and Interaction Model of Abstraction in Interactive Systems

使抽象具象化:交互系统中抽象的设计空间和交互模型

Bryan Min, Sangho Suh, Jim Hollan, Haijun Xia

专题命中 VLA模型 :action model(title)

AI总结 本文通过调研457篇论文,构建了抽象技术的六维设计空间,重新诠释了执行与评估的沟壑,揭示了用户与系统如何通过抽象桥梁进行交互设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11196 2026-05-13 cs.LG 70%

Variational Linear Attention: Stable Associative Memory for Long-Context Transformers

变分线性注意力:适用于长上下文变换器的稳定联想记忆

Vishal Pandey, Gopal Singh

机构 * Independent Researcher(独立研究者) Metriqual

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出变分线性注意力,通过在线正则化最小二乘问题减少内存状态增长,提升长上下文变换器的稳定性与效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23046 2026-05-13 astro-ph.CO 67%

The LOFAR sub-arcsecond view of the high-redshift radio relic in PSZ2G091.83+26.11

LOFAR亚弧秒视角下的高红移无线电遗迹:PSZ2G091.83+26.11

G. Di Gennaro, R. Timmerman, M. Hoeft, F. de Gasperin, R. J. van Weeren, A. Botteon, M. Brüggen, J. M. G. H. J. de Jong, T. W. Shimwell, F. Sweijen, G. Brunetti, R. Cassano, E. De Rubeis, W. Forman, H. J. A. Röttgering, A. Simionescu, H. Ye

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 通过LOFAR在145MHz的亚弧秒分辨率观测,研究高红移簇PSZ2G091.83+26.11中的无线电遗迹,发现其与射电星系的关联,并揭示磁场分布及可能的红移演化。

Comments 11 pages, 11 figures, accepted in Astronomy & Astrophysics

Journal ref A&A 709, A202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11101 2026-05-13 astro-ph.GA 67%

Tracing Radio AGN-Driven Quenching in Post-Starburst Galaxies at Cosmic Noon

追踪宇宙正午时期后星暴星系中由射电活动星系核驱动的星形成淬灭

Pallavi Patil, Kate Rowlands, Katherine Alatalo, Omar Almaini, Vivienne Wild, David Maltby, Rob J. Ivison, Vinod Arumugam, K. Decker French, Timothy Heckman, Mark Lacy, Yuanze Luo, Kristina Nyland, Justin Atsushi Otter, Andreea Petric, Namrata Roy, Maya Skarbinski

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究通过射电连续波分析,探讨宇宙正午时期后星暴星系中射电模式活动星系核是否与星形成淬灭有关,发现后星暴星系的射电亮度显著高于恒星形成星系,暗示可能有活动星系核的贡献。

Comments 25 pages, 8 figures, 2 tables, Accepted for publication in Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV 57%

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏