arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9088 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2506.09930 2025-06-12 cs.RO cs.CV 88%

From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models

Irving Fang, Juexiao Zhang, Shengbang Tong, Chen Feng

机构 * New York University(纽约大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01844 2025-06-03 cs.LG cs.RO 88%

SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene

机构 * Hugging Face Sorbonne University(索邦大学) École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

Comments 24 pages. Code and assets: https://github.com/huggingface/lerobot

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06851 2025-06-03 cs.CL cs.AI cs.CV 88%

Survey on Vision-Language-Action Models

Adilzhan Adilkhanov, Amir Yelenov, Assylkhan Seitzhanov, Ayan Mazhitov, Azamat Abdikarimov, Danissa Sandykbayeva, Daryn Kenzhebek, Dinmukhammed Mukashev, Ilyas Umurbekov, Jabrail Chumakov, Kamila Spanova, Karina Burunchina, Madina Yergibay, Margulan Issa, Moldir Zabirova, Nurdaulet Zhuzbay, Nurlan Kabdyshev, Nurlan Zhaniyar, Rasul Yermagambet, Rustam Chibar, Saltanat Seitzhan, Soibkhon Khajikhanov, Tasbolat Taunyazov, Temirlan Galimzhanov, Temirlan Kaiyrbay, Tleukhan Mussin, Togzhan Syrymova, Valeriya Kostyukova, Yerkebulan Massalim, Yermakhan Kassym, Zerde Nurbayeva, Zhanat Kappassov

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: This submission has been withdrawn due to serious violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00411 2025-06-03 cs.RO cs.AI 88%

LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks

Yi Yang, Jiaxuan Sun, Siqi Kou, Yihan Wang, Zhijie Deng

机构 * Fudan University(复旦大学) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title);action model(title);vision language action(abstract);VLA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23705 2025-05-30 cs.LG cs.RO 88%

Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better

Danny Driess, Jost Tobias Springenberg, Brian Ichter, Lili Yu, Adrian Li-Bell, Karl Pertsch, Allen Z. Ren, Homer Walke, Quan Vuong, Lucy Xiaoyang Shi, Sergey Levine

机构 * Physical Intelligence

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16054 2025-04-23 cs.LG cs.RO 88%

$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization

Physical Intelligence, Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Manuel Y. Galliker, Dibya Ghosh, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Devin LeBlanc, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Allen Z. Ren, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, James Tanner, Quan Vuong, Homer Walke, Anna Walling, Haohuan Wang, Lili Yu, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13446 2025-03-18 cs.RO cs.CV 88%

MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation

Zhenyu Wu, Yuheng Zhou, Xiuwei Xu, Ziwei Wang, Haibin Yan

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments Accepted to CVPR 2025. Project Page: https://gary3410.github.io/momanipVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08007 2025-03-12 cs.RO cs.AI 88%

MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models

Han Zhao, Wenxuan Song, Donglin Wang, Xinyang Tong, Pengxiang Ding, Xuelian Cheng, Zongyuan Ge

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04558 2025-02-10 cs.RO cs.AI 88%

Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture

Hong Lu, Hengxu Li, Prithviraj Singh Shahani, Stephanie Herbers, Matthias Scheutz

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06224 2025-02-07 cs.RO cs.CV 88%

Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks

Jiazhao Zhang, Kunyu Wang, Shaoan Wang, Minghan Li, Haoran Liu, Songlin Wei, Zhongyuan Wang, Zhizheng Zhang, He Wang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

Comments Project page: https://pku-epic.github.io/Uni-NaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17465 2024-11-27 cs.CV cs.AI cs.CL cs.HC 88%

ShowUI: One Vision-Language-Action Model for GUI Visual Agent

Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Weixian Lei, Lijuan Wang, Mike Zheng Shou

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.AI

Comments Technical Report. Github: https://github.com/showlab/ShowUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05191 2024-10-08 cs.RO cs.AI 88%

LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation

Zhijie Wang, Zhehua Zhou, Jiayang Song, Yuheng Huang, Zhan Shu, Lei Ma

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01971 2024-10-04 cs.RO cs.LG 88%

Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust

Asher J. Hancock, Allen Z. Ren, Anirudha Majumdar

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

Comments Website: https://aasherh.github.io/byovla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09246 2024-09-09 cs.RO cs.LG 88%

OpenVLA: An Open-Source Vision-Language-Action Model

Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, Chelsea Finn

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

Comments Website: https://openvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10158 2026-03-12 cs.RO 88%

Cross-Hand Latent Representation for Vision-Language-Action Models

跨手的潜在表示用于视觉-语言-动作模型

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。

Comments Website: https://xl-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10109 2026-02-11 cs.RO 88%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO 88%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11362 2025-12-22 cs.RO 88%

An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges

视觉-语言-动作模型的解剖:从模块到里程碑与挑战

Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng

机构 * IROOTECH TECHNOLOGY(IROOTECH技术公司) Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室) Department of Engineering, King’s College London(伦敦国王学院工程系) Hong Kong Polytechnic University(香港理工大学) Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系) Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 本文系统分析了视觉-语言-动作模型的核心挑战,从模块构建到里程碑发展,为研究者提供结构化指南和未来研究方向。

Comments project page: https://suyuz1.github.io/VLA-Survey-Anatomy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11769 2025-12-15 cs.RO 88%

BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models

BLURR: 一种提升低资源推理的视觉-语言-动作模型

Xiaoyu Ma, Zhengqing Yuan, Zheyuan Zhang, Kaiwen Shi, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱斯大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 BLURR通过轻量级推理包装器提升低资源下的视觉-语言-动作模型推理效率,保持任务成功率的同时降低计算开销。

Comments 10 pages, 3 figures. Code and integration scripts will be released at this http URL: https://github.com/JijiKing-Sam/BLURR-A-Boosted-Low-Resource-Inference-for-Vision-Language-Action-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 88%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13458 2026-07-21 cs.NI 版本更新 88%

From Traditional Automation to Embodied Wireless Intelligence: Vision-Language-Action Empowered Physics-Aware Communication Networks

从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract)

AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。

Comments submitted for possible jounal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02342 2026-07-03 astro-ph.GA 88%

The VLA-COSMOS 3 GHz Large Project: Polarised source counts and catalogue

VLA-COSMOS 3GHz大型项目:极化源计数与目录

S. Ranchod, S. A. Mao, R. P. Deane, V. Smolčić, J. D. Wagenveld, M. Bondi, K. Mooley, E. Schinnerer

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 通过处理VLA-COSMOS 3GHz大型项目的极化数据,进行相关测量和搜索,给出3GHz最深极化源计数,研究极化源计数频率演化,检测到65个极化源,未发现极化恒星形成星系。

Comments 13 pages, 10 figures (main text). Accepted for publication in Astronomy and Astrophysics (A&A)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08962 2026-06-09 cs.LG cs.CV cs.RO 新提交 88%

C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache

C$^3$ache: 利用跨推理块缓存加速世界动作模型

Weisen Zhao, Lam Nguyen, Zhicong Lu, Yuzhang Shang

机构 * George Mason University(乔治梅森大学) University of Central Florida(中佛罗里达大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出C$^3$ache方法,通过跨推理块缓存和重用去噪残差,加速世界动作模型推理,实现高达2.5倍加速且任务成功率几乎无损。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05868 2026-08-11 cs.RO 版本更新 88%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03483 2026-08-05 cs.RO cs.AI cs.CV cs.LG 新提交 88%

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

继续还是重规划?用于自适应执行时长的伯努利继续策略学习

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 针对现有VLA模型固定执行时长重规划的局限,提出BCP框架,通过强化学习训练自适应时长选择,在多个仿真任务、真实机器人任务上提升了成功率,且运行时间更短。

Comments Project page: https://fleetfootwork.github.io/BCP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 88%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交 88%

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12475 2026-06-12 cs.RO 新提交 88%

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration

学习辅助:面向隐式人机协作的协作式VLA模型

Leo Xu, Letian Li, Alex Cuellar, Michael Hagenow

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文研究利用视觉-语言-动作(VLA)模型通过模仿学习实现人机协作,发现动作分块策略在隐式协作中存在演示动作泄漏问题,提出推理时引导方法缓解过早辅助行为,并通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01458 2026-06-02 cs.RO 88%

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

LEGS: 在具身高斯泼溅世界中免遥操作微调VLA用于人形机器人全身操控

Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出LEGS混合模拟器,通过程序化运动基元生成器和两阶段颜色校准,无需遥操作即可合成训练数据,使VLA策略在真实人形机器人操控任务中达到或超越遥操作训练效果。

Comments https://legsvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30695 2026-06-01 cs.RO 88%

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

原始子空间介导VLA中的少样本迁移

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

专题命中 VLA模型 :VLA(title_cn,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本研究通过原始感知训练在视觉-语言-动作(VLA)策略中构建可迁移的子技能库,仅需少量演示即可实现少样本迁移,相比平坦训练方法样本效率提升3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏