arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-12 至 2026-05-12 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 10 篇

2605.10166 2026-05-12 cs.RO 83%

Data-Asymmetric Latent Imagination and Reranking for 3D Robotic Imitation Learning

数据不对称潜在想象与重排序在3D机器人模仿学习中的应用

Lianghao Luo, Xizhou Bu, Ruyan Liu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

专题命中 模仿学习与强化学习 :robotic(title,abstract);world model(abstract);分类 cs.RO

AI总结 本文提出DALI-R框架,通过潜在世界模型和任务完成评分器,利用混合质量轨迹提升3D机器人模仿学习的决策能力,无需额外高质量示范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19741 2026-05-12 cs.RO cs.AI 76%

ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning

ROS-LLM:一个用于具身AI的ROS框架,具有任务反馈和结构化推理

Christopher E. Mower, Yuhui Wan, Hongzhan Yu, Antoine Grosnit, Jonas Gonzalez-Billandon, Matthieu Zimmer, Jinlong Wang, Xinyu Zhang, Yao Zhao, Anbang Zhai, Puze Liu, Daniel Palenicek, Davide Tateo, Cesar Cadena, Marco Hutter, Jan Peters, Guangjian Tian, Yuzheng Zhuang, Kun Shao, Xingyue Quan, Jianye Hao, Jun Wang, Haitham Bou-Ammar

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Leeds(利兹大学) Technical University of Darmstadt(达姆施塔特技术大学) East China Normal University(华东师范大学) Huawei Technologies(华为技术有限公司) ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院)

专题命中 模仿学习与强化学习 :embodied AI(title);分类 cs.RO、cs.AI

AI总结 本文提出一种基于ROS的框架,允许非专家通过自然语言提示和上下文信息编程机器人,结合大语言模型实现任务描述和行为模式控制,实验验证了其在多样化场景中的鲁棒性和扩展性。

Comments This document contains 26 pages and 13 figures

Journal ref Nature Machine Intelligence 8, 313-325 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07969 2026-05-12 cs.LG cs.AI cs.RO stat.ML 67%

Reinforcement Learning with Action Chunking

基于动作分块的强化学习

Qiyang Li, Zhiyuan Zhou, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Q-chunking方法,通过动作分块技术提升长周期稀疏奖励任务的强化学习效率,实现离线到在线学习的样本效率优化。

Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025); 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09096 2026-05-12 cs.RO cs.AI cs.LG 67%

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

当机器人比人类更强大时:从受限演示中学习

Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık

机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) Meta AI Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06182 2026-05-12 cs.RO cs.LG 62%

Apple: Toward General Active Perception via Reinforcement Learning

Apple:通过强化学习实现通用主动感知

Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters

机构 * Department of Computer Science, TU Darmstadt, Germany(德国图林根大学计算机科学系) LIRIS, CNRS UMR5205, École Centrale de Lyon, France(法国里里萨大学LIRIS实验室) LASR Lab & CeTI, TU Dresden, Germany(德国德累斯顿技术大学LASR实验室) DFKI, Hessian.AI, RIG, and Centre for Cognitive Science, TU Darmstadt, Germany(德国图林根大学DFKI、海德堡人工智能、RIG及认知科学中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Apple框架,通过强化学习解决多种主动感知问题,展示了其在触觉探索任务中的有效性,证明了其在机器人领域中的通用性。

Comments 27 pages; 21 figures; accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL 62%

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 62%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08182 2026-05-12 cs.LG cs.AI 62%

Quantile Geometry Regularization for Distributional Reinforcement Learning

分位数几何正则化用于分布性强化学习

Zhaofan Zhang, Minghao Yang, Rufeng Chen, Sihong Xie, Hui Xiong

机构 * Information Hub, AI Thrust(信息中心,人工智能方向)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RQIQN方法,通过分位数估计视角改进分布性强化学习,解决分位数估计退化问题,提升风险敏感导航和Atari游戏性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00623 2026-05-12 cs.RO 57%

Recovering Hidden Reward in Diffusion-Based Policies

从扩散策略中恢复隐藏奖励

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08104 2026-05-12 cs.LG 57%

Distributional Reinforcement Learning via the Cramér Distance

通过Cramér距离进行分布式强化学习

Vanya Aziz, Ivo Nowak, E. M. T Hendrix

机构 * HAW Hamburg(汉堡应用技术大学) Universidad de Málaga(马拉加大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出C-DSAC算法,通过最小化Cramér距离改进分布式强化学习,实验表明其在高复杂度环境中优于基线SAC和现有分布式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏