arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 634 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 18 篇

2607.26452 2026-07-30 cs.AI cs.CV cs.GR 新提交 73%

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

CG-World:面向世界模型的大规模世界状态数据集与协议

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 73%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02580 2026-08-04 cs.RO 新提交 70%

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04880 2026-07-07 cs.RO 新提交 70%

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对大规模预训练模型在特定环境泛化有限的问题,提出PRISM端到端管道,从单张图像和自然语言指令生成个性化机器人数据集,构建场景并合成演示,实验表明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11901 2026-06-11 cs.RO cs.AI 新提交 62%

DuoBench: A Reproducible Benchmark for Bimanual Manipulation in Simulation and the Real World

DuoBench: 一个可复现的双手操作基准,涵盖仿真与现实世界

Tobias Jülg, Seongjin Bien, Simon Hilber, Yannik Blei, Pierre Krack, Maximilian Li, Sven Parusel, Rudolf Lioutikov, Florian Walter, Wolfram Burgard

机构 * University of Technology Nuremberg(纽伦堡工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Franka Robotics Technical University of Munich(慕尼黑工业大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出DuoBench,一个基于FR3 Duo平台的双手操作基准框架,包含11个任务和阶段式评估方案,用于诊断当前策略在双手协调、仿真到现实迁移等方面的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28625 2026-07-31 cs.CV 新提交 57%

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

ACE-Data-0:以人为中心的环境捕获作为具身数据引擎

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) ACE Robotics(ACE机器人公司)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.CV

AI总结 本研究提出以人为中心的具身数据引擎ACE,构建含150小时数据的ACE-Data-0数据集,引入分层基准,暴露现有方法缺陷,为具身AI等领域提供基础。

Comments Project Page: https://ace-data-engine.github.io/ACE-Data-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12894 2026-07-15 cs.CV 新提交 57%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 数据集与评测 :embodied foundation model(abstract);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00726 2026-07-02 cs.CV cs.SD 新提交 57%

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

AV-SyncBench:音视频时间与语义同步的解耦基准测试

Tianhong Zhou, Mingyang Han, Boyu Li, Yuxuan Jiang, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Kunpeng Wang, Jun Song, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 提出AV-SyncBench,首个完全分离音视频时间与语义一致性评估的基准,涵盖语音、音乐和声音三大类10个场景5项挑战任务,基于野外视频构建并人工验证,用于量化特征提取模型的对齐质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31993 2026-07-01 cs.RO 新提交 57%

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

OopsieVerse: 一个具有损伤感知仿真的机器人操作安全基准

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数据集与评测 :vision language action(abstract);分类 cs.RO

AI总结 提出OopsieVerse框架,通过DamageSim检测和量化接触力、温度等损伤信号,在OmniGibson和RoboCasa仿真器中实现损伤感知,用于安全策略学习与评估。

Comments Project website: https://robin-lab.cs.utexas.edu/oopsieverse/. The first two authors contributed equally; order decided by dice roll. Accepted to Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 57%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20521 2026-06-19 cs.CV 新提交 57%

HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

HumanScale: 以自我为中心的人类视频在具身预训练中可超越真实机器人数据

Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong, Jiankai Tu, Xiaotian Tang, Jiaxin Li, Kaiqi Chen, Duomin Wang, Yuqi Wang, Bingyi Kang, Eric Huang, Zhiyang Dou, Zhen Dong, Enze Xie, Wojciech Matusik, Tat-Seng Chua, Daquan Zhou

机构 * PKU(北京大学) NUS(新加坡国立大学) MIT(麻省理工学院) UCSB(加州大学圣塔芭芭拉分校) NVIDIA(英伟达)

专题命中 数据集与评测 :embodied foundation model(abstract);分类 cs.CV

AI总结 本文通过系统比较发现,经过精心设计的过滤和标注流程,以自我为中心的人类视频在具身基础模型预训练中不仅可行,而且性能优于遥操作真实机器人数据,验证了“预训练于人类视频+少量机器人数据适配”的可扩展范式。

Comments Github: https://github.com/DAGroup-PKU/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14192 2026-06-15 cs.LG 新提交 57%

DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation

DRIVE:基于分布与检索增强的价值评估竞价方法

Miduo Cui, Haochen Wang, Shangqin Mao, Xun Yang, Qianlong Xie, Xingxing Wang, Xuri Ge, Ying Zhou, Zhiwei Xu

机构 * Machine Learning, ICML(机器学习,ICML)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 提出DRIVE框架,通过解耦候选动作生成与决策,结合分布建模、检索增强和价值评估,提升离线自动竞价性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 21 篇

2606.12690 2026-06-12 cs.RO cs.AI 新提交 81%

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型

Xin Zhou, Cong Miao

机构 * Astronex Robotics Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07217 2026-06-08 cs.RO cs.CV cs.LG 新提交 80%

Robotic Policy Adaptation via Weight-Space Meta-Learning

通过权重空间元学习实现机器人策略自适应

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

机构 * ItalAI University of Verona(威尼斯大学) Sapeinza University of Rome(罗马萨佩因扎大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出WIZARD框架,通过权重空间元学习从语言指令和演示视频生成任务特定LoRA参数,无需微调即可适应新任务,在LIBERO上性能提升高达14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10363 2026-06-10 cs.RO 新提交 79%

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

机构 * The University of Hong Kong(香港大学) INFIFORCE Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Southern University of Science and Technology(南方科技大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27881 2026-07-31 cs.RO cs.AI 新提交 79%

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架

Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。

Comments Accepted to IROS 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 79%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24008 2026-07-28 cs.RO 新提交 77%

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

FutureRTC:基于预期条件动作分块的实时机器人执行

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作策略实时部署中异步执行的问题,提出FutureRTC框架,通过状态校正和观测预测模块及策略一致性损失,无需修改底层策略,有效提升对推理延迟的鲁棒性,实现更优轨迹、执行速度和任务成功率。

Comments Project Website: https://jianghaiscu.github.io/FutureRTC_proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交 76%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16917 2026-06-23 cs.RO 新提交 74%

Unified Motion-Action Modeling for Heterogeneous Robot Learning

统一运动-动作建模用于异构机器人学习

Yunhao Cao, Shitong Liu, Chao Feng, Meryl Zhang, Xuanchen Lu, Andrew Owens, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO

AI总结 提出UMA模型,利用3D物体运动轨迹作为共享接口,通过掩码生成目标统一视觉运动控制和动力学建模,实现跨异构数据源的多任务预训练,并在部署时支持多种推理模式。

Comments https://uma-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 70%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02195 2026-07-03 cs.RO 新提交 70%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 67%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 62%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 62%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 62%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 62%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交 57%

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏