arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-03 至 2026-03-03 共收录 21 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 21 篇

2509.22643 2026-03-03 cs.RO 92%

VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search

VLA-Reasoner: 通过在线蒙特卡洛树搜索增强视觉-语言-动作模型的推理能力

Wenkai Guo, Guanxing Lu, Haoyuan Deng, Zhenyu Wu, Yansong Tang, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 VLA-Reasoner通过在线蒙特卡洛树搜索增强视觉-语言-动作模型,提升长时间轨迹任务的推理能力与执行效率。

Comments 8 pages, 6 figures, Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 92%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00420 2026-03-03 cs.RO cs.AI cs.SY eess.SY 90%

TMR-VLA:Vision-Language-Action Model for Magnetic Motion Control of Tri-leg Silicone-based Soft Robot

TMR-VLA:一种用于三腿硅基软机器人磁性运动控制的视觉-语言-动作模型

Ruijie Tang, Chi Kit Ng, Kaixuan Wu, Long Bai, Guankun Wang, Yiming Huang, Yupeng Wang, Hongliang Ren

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.AI

AI总结 TMR-VLA通过结合视觉、语言和动作模块,实现三腿硅基软机器人的磁性运动控制与导航能力提升。

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00592 2026-03-03 cs.RO cs.AI cs.CL cs.CV cs.LG 89%

LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models

LangGap:诊断和缩小视觉-语言-动作模型中的语言差距

Yuchen Hou, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore, Singapore(电子与计算机工程系,新加坡国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 LangGap通过系统性语义扰动诊断和多样化任务设计,揭示并缩小VLA模型在理解多样语言指令方面的差距。

Comments 7 pages, 3 figures. Code and benchmark will be available at https://github.com/YC11Hou/langgap

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07530 2026-03-03 cs.RO cs.CV 88%

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA:用于机器人操作的1位视觉-语言-动作模型

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 BitVLA是一种用于机器人操作的1位视觉-语言-动作模型,通过模型设计和优化提升部署效率,实现内存和延迟的显著降低。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11917 2026-03-03 cs.RO 88%

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

OneTwoVLA:一种具有自适应推理能力的统一视觉-语言-动作模型

Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 OneTwoVLA通过自适应推理机制实现视觉-语言-动作统一,提升机器人在复杂任务中的规划、交互与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01210 2026-03-03 cs.CV cs.RO 86%

OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation

OmniVLA:具有统一多传感器感知的物理基础多模态VLA

Heyu Guo, Shanmu Wang, Ruichun Ma, Shiqi Jiang, Yasaman Ghasempour, Omid Abari, Baining Guo, Lili Qiu

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 OmniVLA通过整合多种传感器模态,提升机器人操作的感知能力与任务成功率。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01490 2026-03-03 cs.CV cs.AI 84%

ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models

ATA:通过注意力引导和动作引导推理桥接隐式推理用于视觉-语言-动作模型

Cheng Yang, Jianhao Jiao, Lingyi Huang, Jinqi Xiao, Zhexiang Tang, Yu Gong, Yibiao Ying, Yang Sui, Jintian Lin, Wen Huang, Bo Yuan

机构 * Rutgers University(罗格斯大学) University College London(伦敦大学学院) Rice University(Rice大学) TCL High-Tech Development Co., Ltd.(TCL高科技发展有限公司)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 ATA提出了一种无需训练的隐式推理框架,通过注意力引导和动作引导策略提升视觉-语言-动作模型的任务成功率和鲁棒性,同时保持高效推理。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01469 2026-03-03 cs.RO cs.AI 84%

Mean-Flow based One-Step Vision-Language-Action

基于均流的单步视觉-语言-动作

Yang Chen, Xiaoguang Ma, Bin Zhao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于均流的单步VLA方法,通过消除传统流匹配方法的一致性约束,显著提升生成效率,实现实时动作生成,实验表明其在机器人操作中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01063 2026-03-03 cs.CV 83%

Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures

通过从失败中显式学习解锁VLA在自动驾驶中的潜力

Yuechen Luo, Qimao Chen, Fang Li, Shaoqing Xu, Jaxin Liu, Ziying Song, Zhi-xin Yang, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学) Beijing Jiaotong University(北京交通大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出ELF-VLA框架,通过显式学习失败来提升自动驾驶中VLA模型的性能,实现关键场景的解决并取得SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01700 2026-03-03 cs.RO 79%

TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning

TacMamba: 一种连接快速反射与慢速VLA推理的触觉历史压缩适配器

Zhenan Wang, Yanzhe Wang, Meixuan Ren, Peng Li, Yang Liu, Yifei Nie, Limin Long, Yun Ye, Xiaofeng Wang, Zhen Zhu, Huixu Dong

机构 * Zhejiang University(浙江大学) GigaAI Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 TacMamba通过触觉历史压缩器和双阶段训练策略,实现高频率触觉数据与低频视觉推理的高效融合,提升实时任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00615 2026-03-03 cs.RO 79%

TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation

TGM-VLA:基于任务的混合学习用于高效且鲁棒的机器人操作

Fanqi Pu, Lei Jiang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) The National and Local Co-Build Humanoid Robotics Innovation Center(国家级与地方共建人形机器人创新中心)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 TGM-VLA通过优化关键帧采样策略和引入颜色反转投影模块,提升机器人操作任务的效率和鲁棒性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20786 2026-03-03 astro-ph.HE 78%

Simultaneous JWST, NuSTAR, and VLA Monitoring of Sgr A*: A Unified Picture of the Variable IR, X-ray and Radio Emission

Sgr A*的JWST、NuSTAR和VLA同时监测:IR、X射线和无线电发射的统一图景

F. Yusef-Zadeh, M. Wardle, R. G. Arendt, C. O. Heinke, C. J. Chandler, H. Bushouse, G. A. Moellenbrock, J. M. Michail

专题命中 VLA模型 :VLA(title,abstract)

AI总结 通过JWST、NuSTAR和VLA的联合观测,研究Sgr A*的X射线耀斑及其与近红外和无线电发射的关联,提出磁通量绳重联模型统一不同波段的变源机制。

Comments 27 pages, 14 figures, accepted ApJL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08333 2026-03-03 cs.RO cs.AI 76%

Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging

通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调

Yajat Yadav, Zhiyuan Zhou, Andrew Wagenmaker, Karl Pertsch, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

AI总结 通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调,使策略在保持泛化能力的同时有效学习新技能。

Journal ref The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00182 2026-03-03 cs.RO cs.AI cs.LG cs.SY eess.SY 75%

Embedding Morphology into Transformers for Cross-Robot Policy Learning

将形态学嵌入到变换器中以实现跨机器人策略学习

Kei Suzuki, Jing Liu, Ye Wang, Chiori Hori, Matthew Brand, Diego Romeres, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories (MERL), Cambridge, Massachusetts, USA(三菱电机研究实验室(MERL),马萨诸塞州剑桥)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种机体感知的变换器策略,通过三种机制注入形态学以提升跨机器人策略学习的鲁棒性和性能。

Comments 17 pages, 8 figures (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 74%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01465 2026-03-03 cs.RO cs.AI 73%

Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining

非马尔可夫长时间 horizon 机器人操作 via 关键帧链

Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science and Technology of China(电子科学与技术大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Keyframe-Chaining VLA框架,通过提取和链接关键历史帧,解决长horizon机器人操作中的非马尔可夫依赖问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01441 2026-03-03 cs.CV cs.RO 73%

Unifying Language-Action Understanding and Generation for Autonomous Driving

统一语言-动作理解与生成以实现自动驾驶

Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Li Auto

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00732 2026-03-03 cs.RO cs.CV 73%

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM: 一体化的视觉语言模型用于统一的灵巧手操作

Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV 70%

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00719 2026-03-03 cs.RO 57%

Keyframe-Guided Structured Rewards for Reinforcement Learning in Long-Horizon Laboratory Robotics

关键帧引导的结构化奖励用于长周期实验室机器人强化学习

Yibo Qiu, Shu'ang Sun, Haoliang Ye, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(科学技术大学苏州市先进研究院)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出关键帧引导的结构化奖励方法,用于提升实验室机器人在长周期任务中的精确操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏