arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-17 至 2026-06-17 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 9 篇

2509.26633 2026-06-17 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新 82%

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget:面向人形全身运动操控与场景交互的交互保持数据生成

Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) MIT(麻省理工学院) UC Berkeley(伯克利大学) Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出OmniRetarget引擎,通过交互网格显式建模并保持智能体、地形和物体间的空间与接触关系,将人类运动重定向为机器人运动,生成高质量轨迹以训练强化学习策略,实现长时间跑酷和操控技能。

Comments Project website: https://omniretarget.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05172 2026-06-17 cs.RO cs.AI 版本更新 74%

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning

当生活给你行为克隆,就做Q函数:从行为克隆中提取Q值用于机器人强化学习

Lakshita Dodeja, Ondrej Biza, Shivam Vats, Stephen Hart, Stefanie Tellex, Robin Walters, Karl Schmeckpeper, Thomas Weng

机构 * Rai-Inst

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 提出Q2RL算法,通过从行为克隆策略中提取Q函数并利用Q门控切换策略,实现高效的离线到在线强化学习,在机器人操作任务中达到100%成功率和3.75倍提升。

Comments Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17639 2026-06-17 cs.RO cs.AI 版本更新 74%

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models

RLRC:基于强化学习的压缩视觉-语言-动作模型恢复

Yuxuan Chen, Yixin Han, Yize Huang, Xiao Li

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Key Laboratory of Intelligent Robotics(上海智能机器人重点实验室) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 提出RLRC三阶段压缩恢复流程,通过结构化剪枝、SFT和强化学习恢复以及量化,实现8倍内存减少和2.3倍推理加速,同时保持任务成功率。

Comments 8 pages, 10 figures; accepted by RA-L 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8864-8871, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 70%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19525 2026-06-17 cs.RO 70%

Real-Time Reinforcement Learning for Dynamic Tasks with a Parallel Soft Robot

动态任务的实时强化学习与并行软机器人

James Avtges, Jake Ketchum, Millicent Schlafly, Helena Young, Taekyoung Kim, Allison Pinosky, Ryan L. Truby, Todd D. Murphey

机构 * Department of Mechanical Engineering, Northwestern University(西北大学机械工程系) Department of Materials Science and Engineering, Northwestern University(西北大学材料科学与工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于课程学习的实时强化学习方法,用于在单次部署中实现软机器人的动态平衡,通过并行软执行器和HSA结构实现高可靠性控制。

Comments Published at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17551 2026-06-17 cs.LG cs.AI 新提交 62%

Reversal Q-Learning

逆向Q学习

Aditya Oberai, Seohong Park, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出逆向Q学习(RQL)算法,通过扩展MDP框架和逆向流生成虚拟在线轨迹,结合偏差-方差缩减技术,实现基于流策略的离线强化学习,在50个机器人任务中取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17518 2026-06-17 cs.LG cs.AI q-fin.CP stat.ML 版本更新 62%

Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies

通过分类器模型进行集成强化学习:在交易策略中增强风险回报权衡

Zheli Xiong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在金融交易策略中使用集成强化学习模型的全面研究,利用分类器模型来提升性能。通过将A2C、PPO和SAC等强化学习算法与传统分类器如支持向量机(SVM)、决策树和逻辑回归相结合,探讨不同分类器组如何整合以改善风险回报权衡。研究评估了各种集成方法的有效性,将其与单个强化学习模型在关键金融指标(包括累计回报率、夏普比率(SR)、卡勒姆比率和最大回撤(MDD))上进行比较。结果表明,集成方法在风险调整后的回报方面始终优于基础模型,提供了更好的回撤管理和整体稳定性。然而,我们发现集成性能对方差阈值τ的选择敏感,强调了动态调整τ以达到最佳性能的重要性。本研究强调了将强化学习与分类器结合在自适应决策中的价值,对金融交易、机器人和其他动态环境具有启示。

Comments 23 pages,10 figures, 9 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00611 2026-06-17 cs.RO 版本更新 57%

Physical Imitation Learning: Distilling Control Policies into Passive Elasticity

物理模仿学习:将控制策略蒸馏到被动弹性中

Huyue Ma, Yurui Jin, Helmut Hauser, Rui Wu

机构 * School of Engineering Mathematics and Technology, University of Bristol, and the Bristol Robotics Laboratory(布里斯托大学工程数学与技术学院及布里斯托机器人实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 提出物理模仿学习(PIL)方法,将强化学习控制策略分解为主动与被动部分,被动部分卸载到并联弹性关节,显著降低能耗,在模拟四足机器人上实现高达95%的机械功率卸载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06500 2026-06-17 cs.RO 57%

Cross-Platform Learnable Fuzzy Gain-Scheduled Proportional-Integral-Derivative Controller Tuning via Physics-Constrained Meta-Learning and Reinforcement Learning Adaptation

跨平台可学习模糊增益调度比例-积分-微分控制器调优:通过物理约束元学习和强化学习适应

JiaHao Wu, ShengWen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种分层框架,用于跨平台调优可学习模糊增益调度PID控制器。通过物理约束虚拟机器人合成,结合元学习和轻量强化学习,实现跨平台初始化和部署特定优化,提升跟踪性能和鲁棒性。

Comments 24 pages,15 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏