arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-04 至 2026-08-04 共收录 28 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 23 篇

2608.00569 2026-08-04 cs.RO cs.AI cs.SY eess.SY 新提交 91%

Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization

通过涌现表征专业化实现时延容忍的云边协同视觉-语言-动作模型

Daojie Peng, Fulong Ma, Bingtao Wang, Sheng Wang, Jun Ma

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对移动机器人VLA部署的时延冲突,提出CloudEdgeVLA云边协同策略,通过表征学习处理时间错位,在LIBERO套件上远优于基线,实现高时延下的高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交 91%

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01826 2026-08-04 cs.RO 新提交 91%

Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies

多视图统一相机场:面向仅RGB多相机视觉-语言-动作(VLA)策略的几何形状动作表征

Jiarui Yang, Yehao Lu, Yuning Su, Yufeng Xie, Yu Zhong, Haiyu Lan, Tianjing Hao, Kaixiang Lu, Peiwen Lin, Chuang Wang, Enyu Li, Junwei Liang

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对多相机VLA策略的动作表征缺陷,提出仅训练用的MVUCF框架,通过几何相关目标优化后部署无额外推理开销,在LIBERO、RoboTwin等任务及真实人形实验中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 90%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01573 2026-08-04 cs.RO 新提交 90%

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

揭示并缓解视觉-语言-动作模型中的位置盲区

Dongdong An, Pengjie Zhao, Yihao Huang, Wenbing Tang, Ziming He, Jiayi Zhu, Jifeng Ning, Qin Zhao

机构 * Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Northwest A&F University(西北农林科技大学) Xidian University(西安电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型存在的位置盲区问题,提出两阶段黑箱框架,通过网格划分与单侧对数似然比检验定位盲区,再经LoRA微调缓解,在五个模型上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00391 2026-08-04 cs.RO cs.AI 新提交 90%

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping

门控而非缓存:门控溯源界定无训练VLA令牌跳过的闭环可靠性

Qi Luo, Shuaijun Liu, Hao Zhao, Kunlin Li, Xiaobo Wang, Ningxing Su, Dongsheng Wang, Yun Chen

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI

AI总结 本研究针对无训练VLA令牌跳过的闭环可靠性问题,提出动作松弛刷新方法,集成后修复门控自采集导致的性能崩溃,服务延迟降低18%-22%。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01066 2026-08-04 cs.RO 新提交 90%

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

OC-VLA++:用于视点鲁棒机器人操作的单目几何引导跨视图一致性

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 该研究针对相机覆盖有限时机器人操作的视点泛化问题,提出OC-VLA++模型,通过几何引导的配对视图监督和跨视图动作等变目标提升未见视点泛化能力,性能优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02497 2026-08-04 cs.RO 新提交 89%

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

面向视觉-语言-动作模型的鲁棒指令泛化的基础语义重绑定

Zhaokai Yin, Zhipeng Zhang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型因指令释义导致性能骤降的架构问题,提出GSR方法,在LIBERO-Para基准提升成功率44.6%,推出ParaVLA模型,规避低效数据扩展,实现鲁棒指令泛化。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01028 2026-08-04 cs.RO cs.AI 新提交 89%

VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks

VLAGuard:无线传感器网络中视觉-语言-动作机器人的物理注意力劫持评估与缓解框架

Dongfu Yin, Jinquan Zhang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI

AI总结 VLAGuard框架通过提出VASA攻击和APFT防御,有效降低了无线传感器网络中VLA机器人的物理注意力劫持风险,提升了其在模拟与真实环境中的鲁棒性。

Comments 32 pages, 8 figures, 5 tables. Accepted for publication in Ad Hoc & Sensor Wireless Networks (AHSWN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02365 2026-08-04 cs.AI cs.LG cs.RO 新提交 85%

Faster-WAM: Do World Action Models Need Deep Action Modules?

Faster-WAM:世界动作模型需要深度动作模块吗?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Celia Team(华为Celia团队) Labs(2012实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01221 2026-08-04 cs.RO 新提交 83%

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型

Jinsong Lin, Zikang Pan, Wanhao Liu, Chi Kit Ng, Liangjing Shao, Zihang Yu, Ziyu Wang, Yin Wang, Jiaxi Wang, Jeremy Yuen-Chun Teoh, Zhiyong Xiong, Huxin Gao, Hongliang Ren

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-04 cs.RO 新提交 81%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00337 2026-08-04 cs.RO 新提交 81%

Action Chunk Scheduling for Batched Robot Policy Serving

用于批量机器人策略服务的动作块调度

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO

AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00725 2026-08-04 cs.RO 新提交 79%

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交 79%

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00547 2026-08-04 cs.RO 新提交 79%

Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models

解耦视觉-触觉前瞻:面向世界动作模型的神谕引导式接口发现

Zihang Yao, Chaoyue Ding, Yingying Yu

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对接触丰富的操纵任务中视觉与触觉跨模态接口未被充分探索的问题,提出OVTF框架与AFM模型,在UniVTAC基准7项任务中,AFM平均成功率优于IFM与UniVTAC-ACT。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 79%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01402 2026-08-04 cs.RO cs.AI 新提交 79%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00315 2026-08-04 cs.RO cs.LG cs.SY eess.SY 新提交 79%

Towards General Language-Conditioned Latent Safety Filters

面向通用语言条件的潜在安全过滤器

Ihab Tabbara, Yuxuan Yang, Hussein Sibai

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出语言条件安全过滤器,结合哈密顿-雅可比安全演员与评论家,在多种视觉机器人任务中减少约束违规并实现部分未见过约束实例的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01013 2026-08-04 cs.RO 新提交 77%

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

针对新型机器人实体的OpenVLA-OFT的RL引导

Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文针对形态特殊的缆绳驱动并联机器人,无需实体专属数据集,通过仿真中PPO与GRPO两阶段强化学习,提升了OpenVLA-OFT的指令执行成功率,为仅靠RL生成适配全新实体的语言条件控制器提供了证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 73%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00844 2026-08-04 cs.CY cs.HC 新提交 50%

BoilerSketch: A TA-Supervised, Diagram-First GenAI Practice for Structured Diagrams in CS1/Early CS2

BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践

Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

专题命中 VLA模型 :action model(abstract)

AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。

Comments 9 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02029 2026-08-04 cond-mat.mes-hall 新提交 50%

Emission dynamics in zincblende InAsxP1-x quantum dots in InP nanowires: influence of quantum dot size, composition and nanowire geometry

InP纳米线中闪锌矿型InAsxP1-x量子点的发射动力学:量子点尺寸、组成及纳米线几何结构的影响

Tomasz Gzyl, Giada Bucci, Krzysztof Gawarecki, Elisa García-Tabarés, Anna Musiał, Valentina Zannier, Ylea Vlamidis, Fabio Beltram, Julian V. Montero, Beatriz Galiana, Lucia Sorba, Wojciech Rudno-Rudziński, Grzegorz Sęk

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究InP纳米线中InAsxP1-x量子点的发射动力学,结合实验与理论分析,明确了量子点尺寸、组成及纳米线几何结构对发射的影响,揭示了珀塞尔效应的作用。

Comments 22 pages, 7 figures, submitted to: Photonics and Nanostructures - Fundamentals and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 4 篇

2608.01381 2026-08-04 cs.RO 新提交 77%

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory:面向移动操作的、结合世界模型对齐的轨迹引导动作生成方法

Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 DreamTrajectory是面向移动操作的轨迹引导框架,通过联合预测末端执行器轨迹与全身动作块、结合轨迹世界模型的测试时细化,在MS-HAB及真实任务中大幅提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02578 2026-08-04 cs.RO cs.AI cs.LG 新提交 67%

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

CoWAM:结合世界动作模型(WAMs)的选择性策略干预协调合约

Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究针对双机械臂机器人策略协调问题,提出结合世界动作模型(WAMs)的CoWAM协调合约选择性干预层,经8项模拟任务验证,其协调选择与闭环成功率均显著提升且有害干预极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01397 2026-08-04 cs.RO cs.CV 新提交 62%

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

SG-WAM:几何感知策略空间中的自引导世界建模

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交 62%

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2608.02580 2026-08-04 cs.RO 新提交 70%

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏