arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9119 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9119 篇

1811.09386 2018-11-26 cs.CL cs.LG 79%

Explicit Interaction Model towards Text Classification

Cunxiao Du, Zhaozheng Chin, Fuli Feng, Lei Zhu, Tian Gan, Liqiang Nie

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

Comments 8 pages

Journal ref AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.09245 2018-11-02 cs.AI 79%

A Review on Learning Planning Action Models for Socio-Communicative HRI

Ankuj Arora, Humbert Fiorino, Damien Pellier, Sylvie Pesty

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments Workshop on Affect, Artifcial Compagnon and Interaction, 2016

Journal ref Workshop on Affect, Artifcial Compagnon and Interaction, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00556 2017-12-05 stat.ML cs.LG 79%

A global feature extraction model for the effective computer aided diagnosis of mild cognitive impairment using structural MRI images

Chen Fang, Panuwat Janwattanapong, Chunfei Li, Malek Adjouadi

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

Comments 4 pages, NIPS ML4H 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08961 2017-05-26 cs.AI 79%

Efficient, Safe, and Probably Approximately Complete Learning of Action Models

Roni Stern, Brendan Juba

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref International Joint Conference on Artificial Intelligence (IJCAI) 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.05573 2015-06-19 cs.HC cs.AI 79%

Emergence of synchrony in an Adaptive Interaction Model

Kevin Sanlaville, Gérard Assayag, Frédéric Bevilacqua, Catherine Pelachaud

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Comments Intelligent Virtual Agents 2015 Doctoral Consortium, Aug 2015, Delft, Netherlands. IVA Doctoral Consortium, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.02137 2015-05-29 cs.CY cs.LG 79%

Human Social Interaction Modeling Using Temporal Deep Networks

Mohamed R. Amer, Behjat Siddiquie, Amir Tamrakar, David A. Salter, Brian Lande, Darius Mehri, Ajay Divakaran

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.3437 2014-01-16 cs.AI 79%

Learning Partially Observable Deterministic Action Models

Eyal Amir, Allen Chang

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 33, pages 349-402, 2008

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.6030 2011-09-29 cs.AI 79%

Probabilistic Hybrid Action Models for Predicting Concurrent Percept-driven Robot Behavior

M. Beetz, H. Grosskreutz

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 24, pages 799-849, 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
0905.1174 2015-05-13 astro-ph.GA 79%

The RMS Survey: 6 cm continuum VLA observations towards candidate massive YSOs in the northern hemisphere

J. S. Urquhart, M. G. Hoare, C. R. Purcell, S. L. Lumsden, R. D. Oudmaijer, T. J. T. Moore, A. L. Busfield, J. C. Mottram, B. Davies

专题命中 VLA模型 :VLA(title,abstract)

Comments Accepted for publication in Astronomy and Astrophysics. 15 pages, 9 figures and 5 tables. Full versions of Tables 3, 4 and 5 and Figs. 2, 4 and 7 will only be available via CDS or the RMS website at http:/www.ast.leeds.ac.uk/cgi-bin/RMS/RMS_VLA_IMAGES.cgi

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.1875 2014-06-19 astro-ph.GA astro-ph.CO 79%

A Wideband Polarization Survey of the Extragalactic Sky at 2-4 GHz: A Science White Paper for the VLA Sky Survey

Sui Ann Mao, Julie Banfield, Bryan Gaensler, Lawrence Rudnick, Jeroen Stil, Cormac Purcell, Rainer Beck, Jamie Farnes, Shane O'Sullivan, Dominic Schnitzeler, Tony Willis, Xiaohui Sun, Ettore Carretti, Klaus Dolag, Dmitry Sokoloff, Roland Kothes, Maik Wolleben, George Heald, Joern Geisbuesch, Tim Robishaw, Jose Afonso, Antonio Mario Magalhães, Britt Lundgren, Marijke Haverkorn, Niels Oppermann, Russ Taylor

专题命中 VLA模型 :VLA(title,abstract)

Comments submitted in response to NRAO's call for Community White Papers for a potential VLA Sky Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15680 2026-08-18 cs.RO cs.AI 新提交 79%

Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

Robo-Dopamine 2.0:面向机器人操纵的历史条件感知与分布外感知过程奖励建模

Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang

机构 * Peterson Co(彼得森公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Robo-Dopamine 2.0,一种历史条件与分布外感知的过程奖励模型,结合带符号跳课程训练,提升了机器人操纵的视觉顺序一致性与分布外鲁棒性,在下游强化学习中取得优异的真实世界任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新 79%

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 79%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01402 2026-08-04 cs.RO cs.AI 新提交 79%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00315 2026-08-04 cs.RO cs.LG cs.SY eess.SY 新提交 79%

Towards General Language-Conditioned Latent Safety Filters

面向通用语言条件的潜在安全过滤器

Ihab Tabbara, Yuxuan Yang, Hussein Sibai

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出语言条件安全过滤器,结合哈密顿-雅可比安全演员与评论家,在多种视觉机器人任务中减少约束违规并实现部分未见过约束实例的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新 79%

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29172 2026-08-03 cs.RO cs.AI 新提交 79%

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) NVIDIA Research(英伟达研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24125 2026-07-28 cs.RO cs.AI 版本更新 79%

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training

通过自回归离散预训练实现机器人动作的统一具身VLM推理

Yi Liu, Sukai Wang, Dafeng Wei, Xiaowei Cai, Linqing Zhong, Jiange Yang, Guanghui Ren, Jinyu Zhang, Maoqing Yao, Chuankang Li, Xindong He, Liliang Chen, Jianlan Luo

机构 * AgiBot Research(AgiBot研究机构) AgiBot(AgiBot公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09776 2026-07-16 cs.RO cs.AI 版本更新 79%

HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

通过 VLAC-Cut 引导的管道最大化大规模机器人训练后人类效率

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Haoran Zhang, Fuxian Huang, Zhanhui Lin, Zijun Xu, Weinan Zhang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision language action(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在最大化机器人训练后人类效率,提出含专门分工的高效训练后管道,引入 VLAC-CUT 工具提高数据利用效率,经四个实际任务验证,最终策略成功率达 80% - 95%,吞吐量提升 1.7 倍至 4.2 倍,优于仅人工参与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 79%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02841 2026-07-07 cs.RO cs.CV 新提交 79%

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22435 2026-07-03 cs.RO cs.AI 版本更新 79%

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01067 2026-07-02 cs.RO cs.CV 新提交 79%

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

面向灵巧机器人操作的人为中心的可迁移触觉预训练

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。

Comments The first two authors contribute equally. Orders are decided by flipping a coin

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28758 2026-06-30 cs.CV cs.AI 79%

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

机构 * XPeng Inc.(小鹏汽车)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05377 2026-06-30 cs.RO cs.CV 79%

OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

OpenFrontier: 基于视觉-语言基础的通用导航

Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) University of Bonn(波恩大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22913 2026-06-23 cs.CV cs.AI 新提交 79%

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架

Zisheng Chen, Yuping Qiu, Jianhua Han, Tao Tang, Xiuwei Chen, Likui Zhang, Ying-Cong Chen, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) HKUST(GZ)(香港科技大学(广州)) Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交 79%

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交 79%

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22183 2026-06-16 cs.RO cs.AI 版本更新 79%

Action with Visual Primitives

基于视觉基元的动作生成

Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yuyang Pang, Wenda Xu, Gao Huang

机构 * Anyverse Dynamics Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。

Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/

详情

展开后加载摘要…

URL PDF HTML 收藏