arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-13 至 2026-05-13 共收录 23 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 19 篇

2605.11750 2026-05-13 cs.RO cs.AI cs.CL cs.CV 92%

DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies

DreamAvoid:关键阶段测试时 dreaming 以避免 VLA 策略中的失败

Xianzhe Fan, Yuxiang Lu, Shenyuan Gao, Xiaoyang Wu, Ruihua Han, Manling Li, Hengshuang Zhao

机构 * HKU(香港大学) HKUST(香港理工大学) Northwestern University(西北大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 DreamAvoid 通过关键阶段测试时 dreaming 框架,使 VLA 模型能预测并避免失败,提升任务成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08133 2026-05-13 cs.CV cs.AI 91%

VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving

VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶

Rui Zhao, Haofeng Hu, Zhenhai Gao, Jiaqiao Liu, Gao Fei

机构 * College of Automotive Engineering(汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11809 2026-05-13 cs.AI 91%

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

超越世界坐标动作头:面向视觉-语言-动作模型的运动中心动作框架

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) One Robotics Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.AI

AI总结 本文提出MCF-Proto,一种轻量级动作头,通过运动中心动作框架和原型基动作参数化,提升VLA模型对机器人操作行为的组织与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11114 2026-05-13 cs.RO cs.AI 90%

SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection

SEVO:语义增强的虚拟观察用于通过主动照明和数据导向收集的鲁棒VLA操作

Tianchonghui Fang, Yuan Zhuang, Fei Miao

机构 * School of Computing, University of Connecticut(康奈尔大学计算学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 SEVO通过主动照明和数据导向收集提升跨环境操作鲁棒性,采用三机制改进观察,实现95%和83%的成功率,在新环境中转移率达85%和75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08434 2026-05-13 cs.RO 89%

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

失败前进:面向视觉-语言-动作模型的自适应失败信息学习

Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出AFIL框架,通过利用失败轨迹作为负向指导,提升视觉-语言-动作模型在机器人操作中的鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 89%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10993 2026-05-13 cs.RO 89%

ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

ECHO:面向视觉-语言-动作模型的连续层次记忆

Yanbin Hu, Jin Cui, Jiayi Lu, Ruixuan Yang, Jun Ye, Boran Zhao, Xingyu Chen, Xuguang Lan, Pengju Ren

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室,人工智能与机器人研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ECHO框架,通过连续层次空间提升视觉-语言-动作模型在长周期任务中的表现,实现高效经验检索与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12090 2026-05-13 cs.RO cs.CL cs.CV 89%

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);embodied foundation model(abstract)

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06339 2026-05-13 cs.RO cs.AI 87%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 VLA模型 :vision-language-action(title);action model(title);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12160 2026-05-13 cs.RO cs.AI 84%

Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete

Premover: 通过在指令完成前行动实现快速的视觉-语言-动作控制

Joonha Park, Jiseung Jeong, Taesik Gong

机构 * UNIST(全南大学) The Catholic University of Korea(韩国天主教大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 Premover通过在用户指令完成前进行预计算,减少机器人交互时间,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11383 2026-05-13 cs.RO cs.AI 79%

Vision-Based Hand Shadowing for Robotic Manipulation via Inverse Kinematics

基于视觉的手影法用于机器人操作的逆运动学

Hendrik Chiche, Antoine Jamme, Trevor Rigoberto Martinez, Gabriel Gomes

机构 * OMGrab Inc.(OMGrab公司) University of California, Berkeley(加州大学伯克利分校) Fung Institute for Engineering Leadership(工程领导力基金会)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于单目RGB-D相机的逆运动学映射方法,用于将人类手部动作转化为机器人关节指令,通过实验验证了其在结构化和非结构化环境中的有效性。

Comments v2: accepted at IEEE Access (2026); minor revisions per peer review, added WiLoR occlusion-mitigation experiment, error analysis, EMA ablation, and author photos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 77%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11832 2026-05-13 cs.RO 77%

Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation

基于多视图潜在先验的学习动作流形用于机器人操作

Junjin Xiao, Dongyang Li, Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Feng Xiong, Mu Xu, Xing Wei, Zhiheng Ma, Qing Zhang, Wei-Shi Zheng

机构 * Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(机器智能与先进计算国家重点实验室,教育部,中国) AMap, Alibaba Group(阿里的AMap) Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出利用多视图扩散模型合成潜在新视角,并引入几何引导门控变换器以提升机器人视觉-语言-动作模型的空间感知与操作性能,通过动作流形学习提高动作学习效率,实验证明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11564 2026-05-13 cs.RO 77%

RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning

RIO:灵活的实时机器人输入输出用于跨躯体机器人学习

Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jonathan Francis, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Delft(代尔夫特理工大学) Lavoro AI Bosch Center for AI(博世人工智能中心)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 RIO框架提供灵活的机器人控制和部署组件,支持多种硬件平台和形态,通过开放源代码加速真实机器人学习。

Comments 14 pages, 12 figures, 5 tables. Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11344 2026-05-13 cs.HC 71%

Making Abstraction Concrete: A Design Space and Interaction Model of Abstraction in Interactive Systems

使抽象具象化:交互系统中抽象的设计空间和交互模型

Bryan Min, Sangho Suh, Jim Hollan, Haijun Xia

专题命中 VLA模型 :action model(title)

AI总结 本文通过调研457篇论文,构建了抽象技术的六维设计空间,重新诠释了执行与评估的沟壑,揭示了用户与系统如何通过抽象桥梁进行交互设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11196 2026-05-13 cs.LG 70%

Variational Linear Attention: Stable Associative Memory for Long-Context Transformers

变分线性注意力:适用于长上下文变换器的稳定联想记忆

Vishal Pandey, Gopal Singh

机构 * Independent Researcher(独立研究者) Metriqual

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出变分线性注意力,通过在线正则化最小二乘问题减少内存状态增长,提升长上下文变换器的稳定性与效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23046 2026-05-13 astro-ph.CO 67%

The LOFAR sub-arcsecond view of the high-redshift radio relic in PSZ2G091.83+26.11

LOFAR亚弧秒视角下的高红移无线电遗迹:PSZ2G091.83+26.11

G. Di Gennaro, R. Timmerman, M. Hoeft, F. de Gasperin, R. J. van Weeren, A. Botteon, M. Brüggen, J. M. G. H. J. de Jong, T. W. Shimwell, F. Sweijen, G. Brunetti, R. Cassano, E. De Rubeis, W. Forman, H. J. A. Röttgering, A. Simionescu, H. Ye

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 通过LOFAR在145MHz的亚弧秒分辨率观测,研究高红移簇PSZ2G091.83+26.11中的无线电遗迹,发现其与射电星系的关联,并揭示磁场分布及可能的红移演化。

Comments 11 pages, 11 figures, accepted in Astronomy & Astrophysics

Journal ref A&A 709, A202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11101 2026-05-13 astro-ph.GA 67%

Tracing Radio AGN-Driven Quenching in Post-Starburst Galaxies at Cosmic Noon

追踪宇宙正午时期后星暴星系中由射电活动星系核驱动的星形成淬灭

Pallavi Patil, Kate Rowlands, Katherine Alatalo, Omar Almaini, Vivienne Wild, David Maltby, Rob J. Ivison, Vinod Arumugam, K. Decker French, Timothy Heckman, Mark Lacy, Yuanze Luo, Kristina Nyland, Justin Atsushi Otter, Andreea Petric, Namrata Roy, Maya Skarbinski

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究通过射电连续波分析,探讨宇宙正午时期后星暴星系中射电模式活动星系核是否与星形成淬灭有关,发现后星暴星系的射电亮度显著高于恒星形成星系,暗示可能有活动星系核的贡献。

Comments 25 pages, 8 figures, 2 tables, Accepted for publication in Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV 57%

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 语言条件控制 1 篇

2605.11144 2026-05-13 cs.RO 57%

Forecast-aware Gaussian Splatting for Predictive 3D Representation in Language-Guided Pick-and-Place Manipulation

面向预测的高斯点散布用于语言引导的抓取与放置操作中的预测3D表示

Kaixin Jia, Jiacheng Xu

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 语言条件控制 :language-conditioned robot(abstract);分类 cs.RO

AI总结 本文提出Forecast-GS框架,通过预测3D状态提升语言引导的机器人操作性能,实验显示其在抓取与放置任务中优于基线方法,表明明确预测任务完成状态有助于更可靠的行动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作表示与策略 2 篇

2605.11479 2026-05-13 cs.RO cs.AI 73%

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

通过折扣存活公式评估操纵策略的离线策略评估

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于存活Bellman算子的离线策略评估框架,解决稀疏奖励下任务完成问题,通过保守固定点值函数降低截断偏差,实验证明在折叠任务中优于传统基线方法。

Comments Published at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 62%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2605.10094 2026-05-13 cs.RO cs.AI 79%

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应

Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) One Robotics Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏