arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-02 至 2026-07-02 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2607.00066 2026-07-02 cs.RO 新提交 83%

Learning Expert Strategy for Autonomous Robotic Endovascular Intervention via Decoupled Procedural Execution

通过解耦程序执行学习自主机器人血管内介入的专家策略

Yanxi Chen, Tianliang Yao, Shaolong Tang, Jiyuan Zhao, Hengyu Hu, Zhaoxing Li, Antonio J. Sánchez Egea, Peng Qi

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) Universitat Politècnica de Catalunya (UPC)(加泰罗尼亚理工大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);navigation(abstract);分类 cs.RO

AI总结 提出一种基于学习的专家策略,通过将高层策略决策与低层程序执行解耦,实现自主血管内导航,在仿真和真实机器人上达到>96%成功率并减少29.3%操作步骤。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01225 2026-07-02 cs.LG cs.AI 新提交 73%

Language-Critique Imitation Learning from Suboptimal Demonstrations

语言-批评模仿学习从次优演示中

Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang, Ping-Chun Hsieh, Kenneth Marino, Shao-Hua Sun

机构 * Graduate Institute of Communication Engineering, National Taiwan University (NTU)(国立台湾大学电信工程学研究所) University of Utah(犹他大学) National Yang Ming Chiao Tung University(国立阳明交通大学) NTU Artificial Intelligence Center of Research Excellence(国立台湾大学人工智能卓越研究中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出语言批评框架,用自然语言作为结构化监督信号从次优演示中学习策略,避免压缩为标量,在连续控制任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00808 2026-07-02 cs.LG 新提交 70%

Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos

局部运动至关重要:一种用于从视频中进行强化学习预训练的解构-重组范式

Jinwen Wang, Youfang Lin, Xiaobo Hu, Shuo Wang, Kai Lv

机构 * Beijing Jiaotong University(北京交通大学) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出解构-重组范式(DRP),通过解构全局运动为原子动作学习局部运动表示,再重组以加速下游策略学习,在机器人控制任务中显著提升样本效率。

Comments 20 pages, 16 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pages 9859-9868

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00796 2026-07-02 cs.LG 新提交 70%

Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization

面向视觉强化学习泛化的任务相关表示解耦

Jinwen Wang, Youfang Lin, Xiaobo Hu, Qian Xu, Shuo Wang, Zhuo Chen, Kai Lv

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院交通数据挖掘与具身智能北京市重点实验室) CSSC Intelligent Innovation Research Institute(中国船舶集团智能创新研究院) Zhejiang University(浙江大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出自监督任务相关表示解耦算法T2RD,通过表示一致性、交叉重建和交叉动态预测分离任务相关与无关特征,在控制任务中实现SOTA泛化性能。

Comments 23 pages, 13 figures

Journal ref ACM Transactions on Multimedia Computing, Communications and Applications (TOMM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15283 2026-07-02 cs.LG cs.AI cs.RO 版本更新 67%

Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms

通过强化学习策略梯度算法增强机器的硬件容错能力

Sheila Schoepp, Mehran Taghian, Shotaro Miwa, Yoshihiro Mitsuka, Shadan Golestan, Osmar Zaïane

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) Advanced Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社先进技术研发中心) Information Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社信息技术研发中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文首次系统比较PPO和SAC两种强化学习算法在硬件故障容错中的表现,并研究四种知识迁移策略,实验表明算法能快速恢复故障并存在性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10263 2026-07-02 cs.RO cs.LG 版本更新 62%

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

从先验到专家:通过分布收缩强化学习微调实现高效技能掌握

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01029 2026-07-02 cs.RO 新提交 57%

AMBUSH: Collaborative Capture in Complex Environments with Neural Acceleration

AMBUSH:复杂环境下的协作捕获与神经加速

Junfeng Chen, YinHang Luo, Xinyi Wang, Junrui Li, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Distributed Autonomous Systems and Control Lab, University of Michigan(密歇根大学分布式自主系统与控制实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出基于“伏击”策略的参数化方法,结合混合蒙特卡洛树搜索与神经加速,实现多个慢速追捕者在复杂环境中高效捕获快速逃逸者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-07-02 cs.RO 新提交 57%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏