arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2508.08189 2025-12-24 cs.CV 70%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 70%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11612 2025-12-15 cs.CV eess.IV 70%

Embodied Image Compression

具身图像压缩

Chunyi Li, Rui Qing, Jianbo Zhang, Yuan Tian, Xiangyang Zhu, Zicheng Zhang, Xiaohong Liu, Weisi Lin, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出具身图像压缩问题,建立EmbodiedComp基准测试,证明现有模型在超低比特率下无法完成简单任务,推动具身AI在现实中的应用。

Comments 15 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 70%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04537 2025-12-05 cs.CV 70%

X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale

X-Humanoid:将人类视频机器人化以生成大规模人形视频

Pei Yang, Hai Ci, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 X-Humanoid通过生成式视频编辑方法,将人类视频机器人化,生成大规模人形视频数据集,提升人形机器人研究的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO 70%

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03342 2025-12-02 cs.RO 70%

Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer

Gemini Robotics 1.5:通过先进的具身推理、思考和运动转移推动通用机器人前沿

Gemini Robotics Team, Abbas Abdolmaleki, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Ashwin Balakrishna, Nathan Batchelor, Alex Bewley, Jeff Bingham, Michael Bloesch, Konstantinos Bousmalis, Philemon Brakel, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Christine Chan, Oscar Chang, London Chappellet-Volpini, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, Adrian Collister, David B. D'Ambrosio, Sudeep Dasari, Todor Davchev, Meet Kirankumar Dave, Coline Devin, Norman Di Palo, Tianli Ding, Carl Doersch, Adil Dostmohamed, Yilun Du, Debidatta Dwibedi, Sathish Thoppay Egambaram, Michael Elabd, Tom Erez, Xiaolin Fang, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Ruiqi Gao, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Oliver Groth, Agrim Gupta, Roland Hafner, Steven Hansen, Leonard Hasenclever, Sam Haves, Nicolas Heess, Brandon Hernaez, Alex Hofer, Jasmine Hsu, Lu Huang, Sandy H. Huang, Atil Iscen, Mithun George Jacob, Deepali Jain, Sally Jesmonth, Abhishek Jindal, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Matija Kecman, J. Chase Kew, Donnie Kim, Frank Kim, Junkyung Kim, Thomas Kipf, Sean Kirmani, Ksenia Konyushkova, Li Yang Ku, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Tuan Anh Le, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Guy Lever, Jacky Liang, Li-Heng Lin, Fangchen Liu, Shangbang Long, Caden Lu, Sharath Maddineni, Anirudha Majumdar, Kevis-Kokitsi Maninis, Andrew Marmon, Sergio Martinez, Assaf Hurwitz Michaely, Niko Milonopoulos, Joss Moore, Robert Moreno, Michael Neunert, Francesco Nori, Joy Ortiz, Kenneth Oslund, Carolina Parada, Emilio Parisotto, Amaris Paryag, Acorn Pooley, Thomas Power, Alessio Quaglino, Haroon Qureshi, Rajkumar Vasudeva Raju, Helen Ran, Dushyant Rao, Kanishka Rao, Isaac Reid, David Rendleman, Krista Reymann, Miguel Rivas, Francesco Romano, Yulia Rubanova, Peter Pastor Sampedro, Pannag R Sanketi, Dhruv Shah, Mohit Sharma, Kathryn Shea, Mohit Shridhar, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Rachel Sterneck, Ian Storz, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Saran Tunyasuvunakool, Jake Varley, Grace Vesom, Giulia Vezzani, Maria Bauza Villalonga, Oriol Vinyals, René Wagner, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Chengda Wu, Markus Wulfmeier, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Jimmy Yan, Sherry Yang, Skye Yang, Yuxiang Yang, Hiu Hong Yu, Wenhao Yu, Wentao Yuan, Yuan Yuan, Jingwei Zhang, Tingnan Zhang, Zhiyuan Zhang, Allan Zhou, Guangyao Zhou, Yuxiang Zhou

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Gemini Robotics 1.5通过具身推理、思考和运动转移技术,提升通用机器人在复杂任务中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22555 2025-12-01 cs.RO 70%

Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention

超越成功:通过及时干预从混合质量数据中精炼优雅的机器人操作

Yanbo Mao, Jianlong Fu, Ruoxuan Zhang, Hongxia Xie, Meibao Yao

机构 * Jilin University(吉林大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出LIBERO-Elegant基准和JITI机制,通过离线校准Q学习训练优雅批评者,提升机器人操作的执行质量与优雅度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20720 2025-11-27 cs.CV cs.AI cs.LG cs.RO 70%

DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving

DeeAD: 视觉-语言动作的动态早期退出以实现高效的自动驾驶

Haibo HU, Lianming Huang, Nan Guan, Chun Jason Xue

机构 * City University of Hongkong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 DeeAD通过动态早期退出机制提升自动驾驶中视觉-语言动作模型的效率,实现28%的变换器层稀疏性和29%的延迟减少,同时保持规划质量和安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10560 2025-11-17 cs.CV 70%

OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer

Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, Ziwei Liu

机构 * HKUST(香港科技大学) NTU(国立台湾大学) SYSU(南方科技大学) NUS(国立新加坡大学) Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

Comments Project Page: https://livioni.github.io/OmniVGGT-official/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08865 2025-11-13 cs.RO cs.HC 70%

MirrorLimb: Implementing hand pose acquisition and robot teleoperation based on RealMirror

Cong Tai, Hansheng Wu, Haixu Long, Zhengbin Long, Zhaoyu Zheng, Haodong Xiang, Tao Shen

机构 * ZTE Terminators Group(ZTE终止者集团)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 70%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05491 2025-11-10 cs.CV 70%

Visual Spatial Tuning

Rui Yang, Ziyu Zhu, Yanwei Li, Jingjia Huang, Shen Yan, Siyuan Zhou, Zhe Liu, Xiangtai Li, Shuangye Li, Wenqian Wang, Yi Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26536 2025-10-31 cs.RO 70%

RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration

Huajie Tan, Cheng Chi, Xiansheng Chen, Yuheng Ji, Zhongxia Zhao, Xiaoshuai Hao, Yaoxu Lyu, Mingyu Cao, Junkai Zhao, Huaihai Lyu, Enshen Zhou, Ning Chen, Yankai Fu, Cheng Peng, Wei Guo, Dong Liang, Zhuo Chen, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(3 中国科学院自动化研究所) Beihang University(4 北航大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21746 2025-10-28 cs.RO 70%

Avi: Action from Volumetric Inference

Harris Song, Long Le

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of pennsylvania(宾夕法尼亚大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments NeurIPS 2025 Workshop on Embodied World Models for Decision Making. URL: https://avi-3drobot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21744 2025-10-28 cs.RO 70%

FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation

Yanjia Huang, Shuo Liu, Sheng Liu, Qingxiao Xu, Mingyang Wu, Xiangbo Gao, Zhengzhong Tu

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Electrical & Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) Karlsruhe Institute of Technology, Germany(德国卡尔斯鲁厄理工学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04041 2025-10-07 cs.RO 70%

SITCOM: Scaling Inference-Time COMpute for VLAs

Ayudh Saxena, Harsh Shah, Sandeep Routray, Rishi Rajesh Shah, Esha Pahwa

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments Accepted at the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI (SpaVLE). *Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00907 2025-10-06 cs.AI 70%

Grounding Multimodal LLMs to Embodied Agents that Ask for Help with Reinforcement Learning

Ram Ramrakhya, Matthew Chang, Xavier Puig, Ruta Desai, Zsolt Kira, Roozbeh Mottaghi

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta FAIR

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25966 2025-10-01 cs.RO 70%

MUVLA: Learning to Explore Object Navigation via Map Understanding

Peilong Han, Fan Jia, Min Zhang, Yutao Qiu, Hongyao Tang, Yan Zheng, Tiancai Wang, Jianye Hao

机构 * Dexmal

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24559 2025-09-30 cs.LG 70%

Emergent World Representations in OpenVLA

Marco Molinari, Leonardo Nevali, Saharsha Navani, Omar G. Younis

机构 * London School of Economics(伦敦经济学院) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Department of Computer Science(计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07639 2025-09-23 cs.RO 70%

Fast ECoT: Efficient Embodied Chain-of-Thought via Thoughts Reuse

Zhekai Duan, Yuan Zhang, Shikai Geng, Gaowen Liu, Joschka Boedecker, Chris Xiaoxuan Lu

机构 * University College London(伦敦大学学院) University of Freiburg(弗赖堡大学) Cisco Research(思科研究)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13769 2025-09-18 cs.CV 70%

AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving

Yuechen Luo, Fang Li, Shaoqing Xu, Zhiyi Lai, Lei Yang, Qimao Chen, Ziang Luo, Zixun Xie, Shengyin Jiang, Jiaxin Liu, Long Chen, Bing Wang, Zhi-xin Yang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13347 2025-09-18 cs.AI 70%

OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft

Zihao Wang, Muyao Li, Kaichen He, Xiangyu Wang, Zhancun Mu, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08820 2025-09-11 cs.RO 70%

RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation

Zongzheng Zhang, Chenghao Yue, Haobo Xu, Minwen Liao, Xianglin Qi, Huan-ang Gao, Ziwei Wang, Hao Zhao

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments Accepted to CoRL 2025, Project Page: https://zzongzheng0918.github.io/RoboChemist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19852 2025-08-29 cs.CV 70%

Ego-centric Predictive Model Conditioned on Hand Trajectories

Binjie Zhang, Mike Zheng Shou

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

Comments Code: github.com/showlab/Ego-PM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06535 2025-08-26 cs.RO 70%

MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping

Vineet Bhat, Naman Patel, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10399 2025-08-15 cs.RO 70%

Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning

Wenlong Liang, Rui Zhou, Yang Ma, Bing Zhang, Songlin Li, Yijia Liao, Ping Kuang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08296 2025-06-12 cs.RO 70%

HiBerNAC: Hierarchical Brain-emulated Robotic Neural Agent Collective for Disentangling Complex Manipulation

Hongjun Wu, Heng Zhang, Pengsong Zhang, Jin Wang, Cong Wang

机构 * Johns Hopkins University(约翰霍普金斯大学) Italian Institute of Technology(意大利理工学院) University of Toronto(多伦多大学) Massachusetts General Hospital, Harvard University(哈佛大学麻省总医院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments 31 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01300 2025-06-03 cs.CV 70%

ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding

Yiyang Zhou, Yangfan He, Yaofeng Su, Siwei Han, Joel Jang, Gedas Bertasius, Mohit Bansal, Huaxiu Yao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19767 2025-05-27 cs.RO 70%

RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback

Junyang Shu, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机技术研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏