arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9088 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2511.15605 2025-12-02 cs.RO cs.CL cs.CV 88%

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

SRPO:用于视觉-语言-动作模型的自指政策优化

Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22532 2025-12-01 cs.CV cs.AI 88%

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21663 2025-11-27 cs.CV cs.AI 88%

Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models

基于注意力的视觉-语言-动作模型中逐块稀疏对抗攻击

Naifu Zhang, Wei Tao, Xi Xiao, Qianpu Sun, Yuxin Zheng, Wentao Mo, Peiqiang Wang, Nan Zhang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Huazhong University of Science and Technology, Wuhan, China(华中科技大学) Ping An Technology, Shenzhen, China(平安科技)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 ADVLA通过注意力引导实现低振幅、稀疏的对抗攻击,有效削弱VLA模型的下游动作预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19912 2025-11-26 cs.CV cs.RO 88%

Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving

Reasoning-VLA: 一种用于自动驾驶的快速且通用的视觉-语言-动作推理模型

Dapeng Zhang, Zhenlong Yuan, Zhangquan Chen, Chih-Ting Liao, Yinda Chen, Fei Shen, Qingguo Zhou, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 Reasoning-VLA通过引入可学习的动作查询和链式思维推理的数据格式,实现了在自动驾驶中快速且通用的视觉-语言-动作推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 88%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17366 2025-11-24 cs.RO cs.CV 88%

METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model

METIS:多源自体训练用于集成的灵巧视觉-语言-动作模型

Yankai Fu, Ning Chen, Junkai Zhao, Shaozhe Shan, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 METIS通过多源自体训练构建集成的视觉-语言-动作模型,提升灵巧操作的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12149 2025-11-18 cs.CR cs.AI cs.CV 88%

AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models

Jiayu Li, Yunhan Zhao, Xiang Zheng, Zonghuan Xu, Yige Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09515 2025-11-13 cs.RO cs.AI 88%

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

Fangqi Zhu, Zhengyang Yan, Zicong Hong, Quanxin Shou, Xiao Ma, Song Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ByteDance Seed(字节跳动种子)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments project website: https://wm-po.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19012 2025-11-11 cs.RO cs.AI 88%

Pure Vision Language Action (VLA) Models: A Comprehensive Survey

Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou

机构 * Lanzhou University, China(兰州大学) National University of Singapore, Singapore(新加坡国立大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)

专题命中 VLA模型 :vision language action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05936 2025-11-11 cs.RO cs.AI 88%

10 Open Challenges Steering the Future of Vision-Language-Action Models

Soujanya Poria, Navonil Majumder, Chia-Yu Hung, Amir Ali Bagherzadeh, Chuan Li, Kenneth Kwok, Ziwei Wang, Cheston Tan, Jiajun Wu, David Hsu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments AAAI 2026 (Senior Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05397 2025-11-10 cs.RO cs.CV 88%

EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation

Samarth Chopra, Alex McMoil, Ben Carnovale, Evan Sokolson, Rajkumar Kubendran, Samuel Dickerson

机构 * University of Pittsburgh Center for Research Computing(匹兹堡大学研究中心计算中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments Submitted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00091 2025-11-04 cs.CV cs.RO 88%

Self-Improving Vision-Language-Action Models with Data Generation via Residual RL

Wenli Xiao, Haotian Lin, Andy Peng, Haoru Xue, Tairan He, Yuqi Xie, Fengyuan Hu, Jimmy Wu, Zhengyi Luo, Linxi "Jim" Fan, Guanya Shi, Yuke Zhu

机构 * NVIDIA(NVIDIA公司) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19816 2025-10-31 cs.RO cs.CV 88%

CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling

Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments 39 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13237 2025-10-16 cs.CV cs.LG 88%

Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models

Haochuan Xu, Yun Sing Koh, Shuhuai Huang, Zirun Zhou, Di Wang, Jun Sakuma, Jingfeng Zhang

机构 * The University of Auckland(奥克兰大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) Tokyo University of Science(东京科学大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09269 2025-10-13 cs.CR cs.CV cs.LG 88%

Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects

Zirun Zhou, Zhengyang Xiao, Haochuan Xu, Jing Sun, Di Wang, Jingfeng Zhang

机构 * The University of Auckland(奥克兰大学) The King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00406 2025-10-02 cs.RO cs.CV 88%

VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators

Hengtao Li, Pengxiang Ding, Runze Suo, Yihao Wang, Zirui Ge, Dongyuan Zang, Kexian Yu, Mingyang Sun, Hongyin Zhang, Donglin Wang, Weihua Su

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) Fudan University(复旦大学) Zhengzhou University(郑州大学) BUPT(北京邮电大学) Hebei University of Technology(河北工业大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25681 2025-10-01 cs.RO cs.CV 88%

dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought

Junjie Wen, Minjie Zhu, Jiaming Liu, Zhiyuan Liu, Yicun Yang, Linfeng Zhang, Shanghang Zhang, Yichen Zhu, Yi Xu

机构 * Midea Group(美的集团) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments technique report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20109 2025-09-25 cs.RO cs.AI cs.CL 88%

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

Pengxiang Li, Yinan Zheng, Yue Wang, Huimin Wang, Hang Zhao, Jingjing Liu, Xianyuan Zhan, Kun Zhan, Xianpeng Lang

机构 * LiAuto Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19480 2025-09-25 cs.RO cs.LG 88%

OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12594 2025-09-23 cs.RO cs.CL cs.CV 88%

The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning

Titong Jiang, Xuefeng Jiang, Yuan Ma, Xin Wen, Bailin Li, Kun Zhan, Peng Jia, Yahui Liu, Sheng Sun, Xianpeng Lang

机构 * LiAuto Inc.(LiAuto公司) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments Under review. Project site: https://liauto-research.github.io/LightVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04447 2025-08-27 cs.CV cs.RO 88%

DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge

Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, Fan Lu, He Wang, Zhizheng Zhang, Li Yi, Wenjun Zeng, Xin Jin

机构 * SJTU(上海交通大学) EIT(欧洲研究所) THU(清华大学) Galbot PKU(北京大学) UIUC(伊利诺伊大学香槟分校) USTC(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16292 2025-08-25 cs.AI cs.RO 88%

Do What? Teaching Vision-Language-Action Models to Reject the Impossible

Wen-Han Hsieh, Elvis Hsieh, Dantong Niu, Trevor Darrell, Roei Herzig, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15206 2025-08-21 cs.RO cs.AI 88%

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy

Chi Kit Ng, Long Bai, Guankun Wang, Yupeng Wang, Huxin Gao, Kun Yuan, Chenhan Jin, Tieyong Zeng, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10333 2025-08-15 cs.RO cs.CV 88%

ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver

Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02219 2025-08-05 cs.RO cs.LG 88%

CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning

Dongchi Huang, Zhirui Fang, Tianle Zhang, Yihang Li, Lin Zhao, Chunhe Xia

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02062 2025-08-05 cs.RO cs.AI 88%

RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models

Kaustubh Sridhar, Souradeep Dutta, Dinesh Jayaraman, Insup Lee

机构 * University of Pennsylvania(宾夕法尼亚大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments Conference on Robot Learning 2025 (CoRL 2025), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13587 2025-08-04 cs.RO cs.AI 88%

Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics

Taowen Wang, Cheng Han, James Chenhao Liang, Wenhao Yang, Dongfang Liu, Luna Xinyu Zhang, Qifan Wang, Jiebo Luo, Ruixiang Tang

机构 * Rochester Institute of Technology(罗切斯特技术研究所) University of Missouri - Kansas City(密苏里大学-凯撒城分校) U.S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) Meta AI University of Rochester(罗切斯特大学) Rutgers University(新泽西罗格斯大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments ICCV camera ready; Github: https://github.com/William-wAng618/roboticAttack Homepage: https://vlaattacker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21567 2025-08-01 cs.CV cs.LG 88%

EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models

Feng Jiang, Zihao Zheng, Xiuping Cui, Maoliang Li, JIayu Chen, Xiang Chen

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.LG

Comments There is an error in this paper, and as the author, I request retraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17811 2025-07-08 cs.RO cs.AI cs.SY eess.SY 88%

RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models

Jacky Kwok, Christopher Agia, Rohan Sinha, Matt Foutter, Shulu Li, Ion Stoica, Azalia Mirhoseini, Marco Pavone

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(NVIDIA研究)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10631 2025-06-24 cs.CV cs.RO 88%

HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

Jiaming Liu, Hao Chen, Pengju An, Zhuoyang Liu, Renrui Zhang, Chenyang Gu, Xiaoqi Li, Ziyu Guo, Sixiang Chen, Mengzhen Liu, Chengkai Hou, Mengdi Zhao, KC alex Zhou, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) CUHK(香港中文大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏