arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-23 至 2026-04-23 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2604.19839 2026-04-23 cs.CV cs.AI 81%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19980 2026-04-23 cs.RO cs.SY eess.SY 79%

Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems

利用线性Koopman动力学实现非线性机器人系统的高效强化学习

Wenjian Hao, Yuxuan Fang, Zehui Lu, Shaoshuai Mou

机构 * School of Aeronautics and Astronautics, Purdue University(航空航天学院,普渡大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于模型的强化学习框架,通过Koopman算子理论学习非线性机器人系统的线性提升动力学,并将其整合到actor-critic架构中以优化策略,实验显示在模拟和现实平台中样本效率和控制性能均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20627 2026-04-23 cs.LG cs.RO 73%

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

占用奖励塑造:改进离线目标导向强化学习中的信用分配

Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能技术) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20712 2026-04-23 cs.RO 72%

Visual-Tactile Peg-in-Hole Assembly Learning from Peg-out-of-Hole Disassembly

基于视觉-触觉的 peg-in-hole 组装学习:从 peg-out-of-hole 解组装中学习

Yongqiang Zhao, Xuyang Zhang, Zhuo Chen, Matteo Leonetti, Emmanouil Spyrakos-Papastavridis, Shan Luo

机构 * Department of Engineering, King’s College London(工程系,伦敦国王学院) Department of Informatics, King’s College London(信息学院,伦敦国王学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出一种基于视觉-触觉的 peg-in-hole 组装学习框架,利用其逆过程 peg-out-of-hole 解组装来促进组装学习。通过将两者统一为部分可观测马尔可夫决策过程,利用解组装策略的轨迹反向和随机化提供专家数据,从而提升组装任务的成功率。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 6712-6719, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 70%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏