arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9132 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9132 篇

2603.03195 2026-03-04 cs.CV cs.AI cs.RO 75%

Chain of World: World Model Thinking in Latent Motion

链式世界:潜在运动中的世界模型思维

Fuxiang Yang, Donglin Di, Lulu Tang, Xuancheng Zhang, Lei Fan, Hao Li, Chen Wei, Tonghua Su, Baorui Ma

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) University of New South Wales(新南威尔士大学) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 CoWVLA通过统一世界模型的时间推理与解耦的潜在运动表示,提升视觉-运动学习效率。

Comments Accepted by CVPR2026. Project page: https://fx-hit.github.io/cowvla-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00182 2026-03-03 cs.RO cs.AI cs.LG cs.SY eess.SY 75%

Embedding Morphology into Transformers for Cross-Robot Policy Learning

将形态学嵌入到变换器中以实现跨机器人策略学习

Kei Suzuki, Jing Liu, Ye Wang, Chiori Hori, Matthew Brand, Diego Romeres, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories (MERL), Cambridge, Massachusetts, USA(三菱电机研究实验室(MERL),马萨诸塞州剑桥)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种机体感知的变换器策略,通过三种机制注入形态学以提升跨机器人策略学习的鲁棒性和性能。

Comments 17 pages, 8 figures (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13444 2026-02-17 cs.RO cs.AI cs.CV 75%

FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation

FlowHOI: 基于流的语义引导的双手-物体交互生成用于灵巧机器人操作

Huajian Zeng, Lingyun Chen, Jiaqi Yang, Yuantai Zhang, Fan Shi, Peidong Liu, Xingxing Zuo

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·扎耶德人工智能大学) Technical University of Munich(慕尼黑技术大学) National University of Singapore(新加坡国立大学) Westlake University(西湖大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 FlowHOI通过语义引导的流匹配框架生成双手-物体交互序列,提升机器人操作的准确性和效率。

Comments Project Page: https://huajian-zeng.github.io/projects/flowhoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22714 2026-02-02 cs.LG cs.AI cs.CV 75%

Vision-Language Models Unlock Task-Centric Latent Actions

视觉-语言模型解锁任务导向的潜在动作

Alexander Nikulin, Ilya Zisman, Albina Klepach, Denis Tarasov, Alexander Derevyagin, Andrei Polubarov, Lyubaykin Nikita, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06112 2025-12-17 cs.RO cs.AI cs.CV 75%

WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

WAM-Flow:通过离散流匹配实现自动驾驶的并行粗到细路径规划

Yifang Xu, Jiahao Cui, Feipeng Cai, Zhihao Zhu, Hanlin Shang, Shan Luan, Mingwang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(英伟达智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WAM-Flow通过离散流匹配实现自动驾驶的并行粗到细路径规划,结合几何感知目标和并行生成,提升闭环性能。

Comments 18 pages, 11 figures. Code & Model: https://github.com/fudan-generative-vision/WAM-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 75%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 75%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07339 2025-12-08 cs.RO cs.AI cs.LG 75%

Real-Time Execution of Action Chunking Flow Policies

实时执行动作分块流策略

Kevin Black, Manuel Y. Galliker, Sergey Levine

机构 * Physical Intelligence(物理智能) UC Berkeley(伯克利大学)

专题命中 VLA模型 :VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出实时分块(RTC)方法,通过在执行当前动作分块的同时生成下一个分块,实现动作分块策略的实时异步执行,提升任务吞吐量和精确任务成功率。

Comments published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22780 2025-12-01 cs.RO cs.AI cs.CV 75%

Distracted Robot: How Visual Clutter Undermine Robotic Manipulation

分心的机器人:视觉杂乱如何损害机器人操作

Amir Rasouli, Montgomery Alban, Sajjad Pakdamansavoji, Zhiyuan Li, Zhanguang Zhang, Aaron Wu, Xuan Zhao

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究提出了一种评估协议,从心理学物理角度评估机器人操作在杂乱环境中的性能,发现杂乱度对性能影响显著,且不同策略对杂乱的敏感性不同。

Comments 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05294 2025-11-14 cs.RO cs.AI cs.LG 75%

Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction

Sahar Salimpour, Lei Fu, Kajetan Rachwał, Pascal Bertrand, Kevin O'Sullivan, Robert Jakob, Farhad Keramat, Leonardo Militano, Giovanni Toffetti, Harry Edelman, Jorge Peña Queralta

机构 * Department of Computing, University of Turku(图尔库大学计算机系) Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所) Centre for Artificial Ingelligence, Zurich University of Applied Sciences(应用科学大学人工智能中心) Agentic Systems Lab, Department of Management, Technology and Economics, ETH Zürich(苏黎世联邦理工学院管理、科技与经济系代理系统实验室) Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02832 2025-11-05 cs.RO cs.CV cs.LG 75%

TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System

Yanjie Ze, Siheng Zhao, Weizhuo Wang, Angjoo Kanazawa, Rocky Duan, Pieter Abbeel, Guanya Shi, Jiajun Wu, C. Karen Liu

机构 * Amazon FAR(亚马逊 FAR) Stanford University(斯坦福大学) USC(美国大学) UC Berkeley(伯克利大学) CMU(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Website: https://yanjieze.com/TWIST2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05227 2025-11-04 cs.RO cs.CV cs.LG cs.MM cs.SY eess.SY 75%

NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving

Qucheng Peng, Chen Bai, Guoxiang Zhang, Bo Xu, Xiaotong Liu, Xiaoyin Zheng, Chen Chen, Cheng Lu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07778 2025-10-10 cs.RO cs.AI cs.CV 75%

IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction

Yandu Chen, Kefan Gu, Yuqing Wen, Yucheng Zhao, Tiancai Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Dexmal

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07730 2025-10-10 cs.LG cs.AI cs.RO 75%

DEAS: DEtached value learning with Action Sequence for Scalable Offline RL

Changyeon Kim, Haeone Lee, Younggyo Seo, Kimin Lee, Yuke Zhu

机构 * KAIST(韩国科学技术院) UC Berkeley(伯克利大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Project website: https://changyeon.site/deas

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23540 2025-08-01 cs.RO cs.AI cs.CV 75%

A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving

Yi Zhang, Erik Leo Haß, Kuo-Yi Chao, Nenad Petrovic, Yinglei Song, Chengdong Wu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Embedded Systems Technical University of Munich (TUM)(机器人、人工智能与嵌入系统教授席 Technical University of Munich)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15493 2025-07-23 cs.RO cs.AI cs.CV 75%

GR-3 Technical Report

Chilam Cheang, Sijin Chen, Zhongren Cui, Yingdong Hu, Liqun Huang, Tao Kong, Hang Li, Yifeng Li, Yuxiao Liu, Xiao Ma, Hao Niu, Wenxuan Ou, Wanli Peng, Zeyu Ren, Haixin Shi, Jiawen Tian, Hongtao Wu, Xin Xiao, Yuyang Xiao, Jiafeng Xu, Yichu Yang

机构 * ByteDance(字节跳动)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Tech report. Authors are listed in alphabetical order. Project page: https://seed.bytedance.com/GR3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12768 2025-07-18 cs.CV cs.LG cs.RO 75%

AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation

Hengkai Tan, Yao Feng, Xinyi Mao, Shuhe Huang, Guodong Liu, Zhongkai Hao, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) THBI Lab(THBI实验室) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13679 2025-06-17 cs.RO cs.AI cs.CV 75%

ROSA: Harnessing Robot States for Vision-Language and Action Alignment

Yuqing Wen, Kefan Gu, Haoxuan Liu, Yucheng Zhao, Tiancai Wang, Haoqiang Fan, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Dexmal

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03174 2025-05-07 cs.RO cs.CV cs.LG 75%

Automated Data Curation Using GPS & NLP to Generate Instruction-Action Pairs for Autonomous Vehicle Vision-Language Navigation Datasets

Guillermo Roque, Erika Maquiling, Jose Giovanni Tapia Lopez, Ross Greer

机构 * Machine Intelligence, Interaction, and Imagination (Mi 3 ) Laboratory(机器智能、交互与想象(Mi 3)实验室) University of California, Merced(加州大学默塞德分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03151 2025-01-07 cs.AI cs.CV cs.LG 75%

Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches

Alhassan Mumuni, Fuseini Mumuni

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11337 2024-12-17 cs.RO cs.AI cs.CV 75%

Modality-Driven Design for Multi-Step Dexterous Manipulation: Insights from Neuroscience

Naoki Wake, Atsushi Kanehira, Daichi Saito, Jun Takamatsu, Kazuhiro Sasabuchi, Hideki Koike, Katsushi Ikeuchi

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 8 pages, 5 figures, 2 tables. Last updated on December 14th, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12871 2024-05-10 cs.CV cs.AI cs.CL cs.LG 75%

An Embodied Generalist Agent in 3D World

Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, Puhao Li, Yan Wang, Qing Li, Song-Chun Zhu, Baoxiong Jia, Siyuan Huang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2024. The first four authors contribute equally. Project page: https://embodied-generalist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12208 2026-04-15 cs.RO cs.AI 74%

Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving

揭示端到端自动驾驶中导航理解的惊人效能

Zhihua Hua, Junli Wang, Pengfei LI, Qihao Jin, Bo Zhang, Kehua Sheng, Yilun Chen, Zhongxue Gan, Wenchao Ding

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Didi Chuxing(滴滴出行) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出SNG框架,通过真实导航模式高效表示全局导航信息,结合导航路径与分步信息,提升自动驾驶的全局与局部规划能力,实现无需辅助损失函数的高精度导航建模。

Comments 8 pages, 6 figures. ICRA 2026. Code available at https://fudan-magic-lab.github.io/SNG-VLA-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27933 2026-08-07 cs.AI 版本更新 74%

The Geometry of Flow-Matching Uncertainty: A Cost-free Uncertainty Proxy and Its Application in Flow-based VLA Failure Detection

流匹配不确定性的几何本质与自由代理

Ziyang Rao, Yiren Zhao, Weiyu Guo, Ben Fei, Yandong Guo, Hui Xiong

专题命中 VLA模型 :VLA(title);分类 cs.AI

AI总结 该研究针对流匹配(FM)不确定性估计方法的缺陷,提出去噪加速度(accel)作为高泛化无成本的不确定性代理,可提前识别FM生成动作的失败,性能优于相关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28762 2026-08-03 cs.LG 新提交 74%

Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators

面向物理信息神经网络与神经算子的特征交互建模

Quan Gu, Hongxia Liu

专题命中 VLA模型 :action model(title);分类 cs.LG

AI总结 该研究将因子分解机衍生的特征交互模块嵌入物理信息神经网络与神经算子,提出FM-PINN、FM-Operator等模型,提升了激波主导等问题的PDE解近似精度,为相关物理建模提供了新方向。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17568 2026-05-21 cs.LG 74%

Structured Neural Marked Point Processes for Interpretable Event Interaction Modeling

结构化神经标记点过程用于可解释的事件交互建模

Zhitong Xu, Qiwei Yuan, Yinghao Chen, Shandian Zhe, Bin Shen

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院) Celonis AI

专题命中 VLA模型 :action model(title);分类 cs.LG

AI总结 本文提出了一种结构化神经标记点过程(SNMPP),通过显式发现事件级和类别级的关系,实现高灵活性的建模,同时在合成和现实数据集上验证了其揭示结构关系和强预测性能的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18627 2026-05-19 cs.AI 74%

Learning Lifted Action Models from Traces with Minimal Information About Actions and States

从动作轨迹中学习提升的动作模型:最少关于动作和状态的信息

Jonas Gösgens, Niklas Jansen, Hector Geffner

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 VLA模型 :action model(title);分类 cs.AI

AI总结 本文研究了在不完全信息下从动作轨迹中学习STRIPS+动作域的问题,提出了三种通用情况下的算法和完备性结果,假设选定的动作参数完全可观察,从而在不同可观察性假设下确定等效域的学习条件。

Comments accepted at KR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24188 2026-04-28 cs.RO cs.GR 74%

Generalizable Friction Coefficient Estimation via Material Embedding and Proxy Interaction Modeling

通过材料嵌入和代理交互建模实现通用摩擦系数估计

Zhendong Wang, Huamin Wang

机构 * Style3D Research(Style3D研究院)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 本文提出基于代理材料的摩擦系数估计框架,通过材料嵌入和融合函数实现高效预测,减少实验成本并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17058 2026-03-19 cs.GT cs.MA cs.RO cs.SY eess.SY math.OC 74%

Asymmetric Nash Seeking via Best Response Maps: Global Linear Convergence and Robustness to Inexact Reaction Models

不对称纳什寻求 via 最佳反应映射:全局线性收敛性与对不精确反应模型的鲁棒性

Mahdis Rabbani, Navid Mojahed, Shima Nazari

机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 本文研究了不对称信息双玩家约束博弈的全局线性收敛性和对不精确反应模型的鲁棒性,提出了一种不对称投影梯度下降-最佳反应迭代方法,证明了在最佳反应映射精确时的全局线性收敛性,并分析了不精确情况下的误差界。

Comments 6 Pages, 2 Figures, Preprint submitted to IEEE L-CSS and CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 74%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏