arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-17 至 2026-03-17 共收录 18 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 18 篇

2603.14523 2026-03-17 cs.CV cs.AI cs.RO 91%

VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

VLA-Thinker: 通过图像推理增强视觉-语言-动作模型

Chaoyang Wang, Wenrui Bao, Sicheng Gao, Bingxin Xu, Yu Tian, Yogesh S. Rawat, Yunhao Ge, Yuzhang Shang

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出VLA-Thinker框架,通过动态可调用的推理动作提升视觉语言动作模型的能力,通过两阶段训练流程提升操控性能,在LIBERO和RoboTwin 2.0基准上取得显著成果。

Comments We introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18953 2026-03-17 cs.RO cs.AI 91%

Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations

Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性

Hanqing Liu, Shouwei Ruan, Jiahuan Long, Junqi Wu, Jiacheng Hou, Huili Tang, Tingsong Jiang, Weien Zhou, Wen Yao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07904 2026-03-17 cs.LG cs.RO 91%

DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models

DyQ-VLA: 时序动态感知的视觉-语言-动作模型量化

Zihao Zheng, Hangyu Cao, Sicheng Tian, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 本文提出DyQ-VLA,通过动态量化框架解决视觉-语言-动作模型在时序动态敏感性和实时分配上的问题,实现内存占用降低30.9%且性能保持99.5%,在仿真和现实场景中分别获得1.49倍和1.43倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15046 2026-03-17 cs.RO cs.AI 90%

AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation

AnoleVLA:基于深度状态空间模型的轻量级视觉-语言-动作模型用于移动操作

Yusuke Takagi, Motonari Kambara, Daichi Yashima, Koki Seno, Kento Tokura, Komei Sugiura

机构 * Keio University(keio大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出AnoleVLA,一种轻量级视觉-语言-动作模型,通过深度状态空间模型高效处理多模态序列,提升移动操作的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13782 2026-03-17 cs.RO cs.CV 89%

Your Vision-Language-Action Model Already Has Attention Heads For Path Deviation Detection

您的视觉-语言-动作模型已具备路径偏差检测的注意力头

Jaehwan Jeong, Evelyn Zhu, Jinying Lin, Emmanuel Jaimes, Tuan-Anh Vu, Jungseock Joo, Sangpil Kim, M. Khalid Jawed

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV

AI总结 本文提出一种无需训练的异常检测框架,通过监控VLA模型中的三个注意力头实时检测路径偏差,并利用轻量级RL策略进行恢复,展示了其在物理机器人上的实际鲁棒性。

Comments Keywords: Vision-Language Action (VLA), Reinforcement Learning (RL), Navigation Path Recovery, Robot Operating System (ROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13925 2026-03-17 cs.RO cs.AI 88%

SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization

SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束

Jiashun Li, Xiaoyu Shi, Hong Xie, Mingsheng Shang, Yun Lu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 88%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14972 2026-03-17 cs.RO 83%

Learning from Mistakes: Post-Training for Driving VLA with Takeover Data

从错误中学习:使用接管数据进行驾驶VLA的后训练

Yinfeng Gao, Deqing Liu, Qichao Zhang, Yupeng Zheng, Haochen Tian, Guang Li, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出TakeVLA框架,通过预接管语言监督和场景做梦方法,提升驾驶VLA的闭环性能与安全性,实验显示在Bench2Drive基准上优于SimLingo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 83%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 81%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12101 2026-03-17 cs.RO cs.AI cs.LG 80%

Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway

解耦动作专家:将任务知识限制在条件路径中

Jian Zhou, Sihao Lin, Shuai Fu, Zerui Li, Gengze Zhou, Qi WU

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 73%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15186 2026-03-17 cs.RO 70%

NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation

NavGSim: 高保真度高斯点扩散模拟器用于大规模导航

Jiahang Liu, Yuanxing Duan, Jiazhao Zhang, Minghan Li, Shaoan Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(中国人工智能研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 NavGSim基于高斯点扩散框架,生成高保真度大规模导航环境,通过高斯点扩散切片技术提取可导航区域,提供多GPU支持的API,提升视觉-语言-动作模型的场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13825 2026-03-17 cs.RO 70%

Building Explicit World Model for Zero-Shot Open-World Object Manipulation

构建显式世界模型以实现零样本开放世界物体操控

Xiaotong Li, Gang Chen, Javier Alonso-Mora

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出基于显式世界模型的框架,通过构建物理基础的数字孪生实现零样本泛化,无需任务特定示范即可完成开放集操控任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14289 2026-03-17 cs.LG cs.NA math.NA 57%

Windowed Fourier Propagator: A Frequency-Local Neural Operator for Wave Equations in Inhomogeneous Media

窗口傅里叶传播器:一种频率局部的神经算子用于不均匀介质中的波动方程

Yiyang Cai, Zixuan Qiu, Yunlu Shu, Jiamao Wu, Yingzhou Li, Tianyu Wang, Xi Chen

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出窗口傅里叶传播器,一种频率局部神经算子,用于高效解决不均匀介质中波动方程的模拟问题,通过学习紧凑的局部传播器实现计算效率,保留叠加性以提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15480 2026-03-17 astro-ph.HE 50%

Shocks in the Symbiotic Recurrent Nova V3890 Sgr: VLBI Radio Imaging and Fermi GeV Gamma-Rays

V3890 Sgr共生重复新星爆发中的激波:VLBI射电成像与费米GeV伽马射线

Isabella Molina, Peter Craig, Rebecca Diesing, Laura Chomiuk, Justin D. Linford, Brian D. Metzger, Jun Yang, Brandon Benavente, Kim L. Page, Kirill V. Sokolovsky, Elias Aydi, Amy J. Mioduszewski, Koji Mukai, Miriam M. Nyamai, Michael P. Rupen, J. L. Sokoloski, Montana N. Williams

专题命中 VLA模型 :VLA(abstract)

AI总结 通过VLBI射电成像和费米GeV伽马射线观测研究V3890 Sgr2019次爆发,揭示激波与周围星周物质相互作用的形态演化及射电与伽马射线发射区的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11120 2026-03-17 astro-ph.SR 50%

First Detection of an Ultracool Dwarf at 340 MHz: VLITE Observations of EI Cancri AB

首次在340 MHz检测到一颗超低温矮星:VLITE对EI Cancri AB的观测

Michele L. Silverstein, Tracy E. Clarke, Wendy M. Peters, Emil Polisensky, Jackie Villadsen, Jordan M. Stone

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过VLITE在340 MHz观测到EI Cancri AB,揭示了超低温矮星在该频率下的无线电发射,为理解其磁活动和周围盘结构提供了新数据。

Comments 13 pages, 2 figures, 3 tables, resubmitted to AAS Journals (round 2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17893 2026-03-17 nucl-ex 50%

Measurement of Proton-Induced Reactions on Lanthanum from 55--200 MeV by Stacked-Foil Activation

通过堆叠箔激活法测量55-200 MeV范围内镧的质子诱导反应

Jonathan T. Morrell, Ellen M. O'Brien, Michael Skulski, Andrew S. Voyles, Dmitri G. Medvedev, Veronika Mocko, Lee A. Bernstein, C. Etienne Vermeulen

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过堆叠箔激活实验测量了镧在55-200 MeV能量范围内的质子诱导反应,提供了30种反应产物的截面数据,并改进了核反应模型预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏