arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-04 至 2026-06-04 共收录 26 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 26 篇

1806.06161 2026-06-04 cs.RO cs.LG cs.SY eess.SY 81%

BaRC: Backward Reachability Curriculum for Robotic Reinforcement Learning

BaRC:机器人强化学习中的逆向可达性课程

Boris Ivanovic, James Harrison, Apoorva Sharma, Mo Chen, Marco Pavone

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学学院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出BaRC方法,利用物理先验知识设计课程方案,通过逆向可达性策略加速连续控制MDP中模型无关RL算法的训练,提升性能并减少探索需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02860 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 81%

Gaussian Processes for Data-Efficient Learning in Robotics and Control

高斯过程在机器人和控制中的数据高效学习

Marc Peter Deisenroth, Dieter Fox, Carl Edward Rasmussen

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于高斯过程的非参数转移模型,通过提取更多数据信息加速学习,减少模型误差影响,实现高效自主学习。

Comments 20 pages, 29 figures; fixed a typo in equation on page 8

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, issue no 2, pages 408-423, February 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01292 2026-06-04 cs.RO cs.SY eess.SY 79%

A General Safety Framework for Learning-Based Control in Uncertain Robotic Systems

一种用于不确定机器人系统中基于学习的控制的通用安全框架

Jaime F. Fisac, Anayo K. Akametalu, Melanie N. Zeilinger, Shahab Kaynama, Jeremy Gillula, Claire J. Tomlin

机构 * Department of Mechanical and Process Engineering, ETH Zurich(瑞士苏黎世联邦理工学院机械与过程工程系) Clearpath Robotics(Clearpath机器人公司) Electronic Frontier Foundation(电子前沿基金会)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种通用安全框架,结合Hamilton-Jacobi可达性方法和任意学习算法,通过近似系统动力学知识确保约束满足,同时减少对学习过程的干扰,并引入贝叶斯机制提升安全分析。

Comments Accepted for publication in IEEE Transactions on Automatic Control. Video with experiments: https://youtu.be/WAAxyeSk2bw

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09865 2026-06-04 eess.SY cs.SY 78%

Adaptive Guidance and Integrated Navigation with Reinforcement Meta-Learning

自适应引导与集成导航的强化元学习

Brian Gaudet, Richard Linares, Roberto Furfaro

专题命中 模仿学习与强化学习 :navigation(title,abstract)

AI总结 本文提出了一种基于强化元学习的自适应引导系统,采用递归策略和价值函数近似器,通过递归网络层使部署策略能实时适应作用在智能体上的环境力,在四个具有未知但高度动态变化的挑战性环境中比较了DR/DV引导律、非递归策略的RL代理和递归策略的RL代理的性能,并展示了RL元学习优化的策略在火星着陆环境中仅使用多普勒雷达高度计读数,在小行星着陆环境中仅使用LIDAR高度计读数时实现引导和导航的整合能力。

Comments arXiv admin note: substantial text overlap with arXiv:1901.04473

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09627 2026-06-04 cs.LG cs.RO cs.SY eess.SY 77%

Barrier-Certified Adaptive Reinforcement Learning with Applications to Brushbot Navigation

具有应用的障碍证书自适应强化学习:Brushbot导航

Motoya Ohnishi, Li Wang, Gennaro Notomista, Magnus Egerstedt

机构 * School of Electrical Engineering, Royal Institute of Technology(皇家理工学院电气工程学院) Georgia Institute of Technology(佐治亚理工学院) RIKEN Center for Advanced Intelligence Project(日本理化学研究所高级智能研究中心) School of Mechanical Engineering(机械工程学院)

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO、cs.LG;robotics(journal_ref)

AI总结 本文提出了一种安全学习框架,结合自适应模型学习算法和障碍证书,用于具有可能非平稳智能体动态的系统。通过稀疏优化技术提取模型的动态结构,并利用学习的模型结合控制障碍证书来约束策略(反馈控制器),以保持安全性,即避免特定的不利状态空间区域。在某些条件下,保证了在安全被非平稳性破坏后,以李雅普诺夫稳定性的方式恢复安全。此外,将动作-价值函数近似重新公式化,使任何基于内核的非线性函数估计方法都能应用于我们的自适应学习框架。最后,保证了障碍证书策略优化的解是全局最优的,确保在温和条件下进行贪心策略改进。所得到的框架通过四旋翼无人机的模拟进行验证,该无人机此前在安全学习文献中被假设为平稳性,然后在动态未知、高度复杂且非平稳的Brushbot机器人上进行测试。

Comments ©2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Published in IEEE Transactions on Robotics, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.10371 2026-06-04 cs.RO cs.LG cs.SY eess.SY 76%

Reinforcement learning for non-prehensile manipulation: Transfer from simulation to physical system

基于非操控操作的强化学习:从仿真到物理系统的迁移

Kendall Lowrey, Svetoslav Kolev, Jeremy Dao, Aravind Rajeswaran, Emanuel Todorov

机构 * University of Washington(华盛顿大学) Roboti LLC(Roboti公司)

专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于仿真的强化学习方法,用于非操控操作任务,通过在仿真环境中训练策略,成功迁移到物理系统中,且在模型集合训练下提升了策略的鲁棒性。

Comments Accepted at IEEE SIMPAR 2018. Project page: https://sites.google.com/view/phantomsim2real

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.03314 2026-06-04 cs.CV cs.SY eess.SY 74%

A Robotic Auto-Focus System based on Deep Reinforcement Learning

基于深度强化学习的机器人自动对焦系统

Xiaofan Yu, Runze Yu, Jingsong Yang, Xiaohui Duan

机构 * Center of Wireless Communication and Signal Processing(无线通信与信号处理中心)

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.CV

AI总结 本文提出一种端到端的自动对焦方法,通过深度强化学习在视觉输入中学习对焦策略,实现自动清晰成像。方法通过离散化动作空间和应用DQN,解决自动对焦问题并推广至基于视觉的控制问题。

Comments To Appear at ICARCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.08705 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

A General Framework for Structured Learning of Mechanical Systems

结构机械系统学习的通用框架

Jayesh K. Gupta, Kunal Menda, Zachary Manchester, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种通用框架,用于结构化学习机械系统,通过结合先验知识和训练表达式近似器来提高模型的准确性和效率。

Comments 10 pages, 7 figures. First two authors contributed equally. Submitted to IROS/RA-L. Code at https://github.com/sisl/mechamodlearn/

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11706 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY stat.ML 67%

Supervised Policy Update for Deep Reinforcement Learning

深度强化学习中的监督策略更新

Quan Vuong, Yiming Zhang, Keith W. Ross

机构 * University of California, San Diego(加州大学圣地亚哥分校) New York University(纽约大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种新的样本效率高的方法,称为监督策略更新(SPU),用于深度强化学习。该方法通过当前策略生成的数据,在非参数化的近端策略空间中构建并求解一个约束优化问题,然后利用监督回归将最优的非参数化策略转换为参数化策略,从而生成新的样本。该方法适用于离散和连续动作空间,并能处理多种接近约束。本文展示了如何通过该方法解决自然策略梯度和信任区域策略优化(NPG/TRPO)以及近端策略优化(PPO)问题。SPU的实现比TRPO更简单,在样本效率方面,实验表明SPU在Mujoco模拟机器人任务中优于TRPO,在Atari视频游戏任务中优于PPO。

Comments Accepted as a conference paper at ICLR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.00748 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY 67%

Continuous Deep Q-Learning with Model-based Acceleration

基于模型的连续深度Q学习加速

Shixiang Gu, Timothy Lillicrap, Ilya Sutskever, Sergey Levine

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出连续深度Q学习算法NAF及基于模型的加速方法,用于提升连续控制任务的样本效率和学习速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02312 2026-06-04 cs.AI cs.LG cs.RO cs.SY eess.SY 67%

A Framework for Constrained and Adaptive Behavior-Based Agents

一种用于约束和自适应行为基 agent 的框架

Renato de Pontes Pereira, Paulo Martins Engel

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种框架,通过强化学习节点整合到行为树中,解决约束 agent 的学习能力问题,并展示其与分层强化学习选项的关系,确保嵌套学习节点的收敛性。

Comments 2015; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.01250 2026-06-04 cs.RO cs.LG cs.SY eess.SY 66%

Virtual vs. Real: Trading Off Simulations and Physical Experiments in Reinforcement Learning with Bayesian Optimization

虚拟与现实:在强化学习中权衡模拟与物理实验

Alonso Marco, Felix Berkenkamp, Philipp Hennig, Angela P. Schoellig, Andreas Krause, Stefan Schaal, Sebastian Trimpe

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出利用模拟数据优化强化学习,通过结合低成本但不准确的模拟信息与高成本但准确的物理实验,提高效率。

Comments 7 pages, 6 figures, to appear in IEEE 2017 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04749 2026-06-04 cs.RO cs.LG 62%

COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection

COP-Q:基于Cholesky有序投影的安全优先强化学习机器人控制

Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan, Julian F. P. Kooij

机构 * Department of Cognitive Robotics, Delft University of Technology(代尔夫特理工大学认知机器人系) Department of Intelligent Systems, Delft University of Technology(代尔夫特理工大学智能系统系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 提出COP-Q方法,通过Cholesky分解编码目标优先级并利用联合Q值空间的广义置信界,在安全优先的离线策略强化学习中平衡安全与奖励目标,减少过度保守性,提升样本效率。

Comments 7 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02219 2026-06-04 cs.RO cs.LG cs.SY eess.SY 62%

Training in Task Space to Speed Up and Guide Reinforcement Learning

在任务空间中训练以加速和引导强化学习

Guillaume Bellegarda, Katie Byl

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出在任务空间中训练以提高强化学习的效率和稳定性,通过简化高自由度系统模型、利用正逆运动学以及在笛卡尔空间中学习运动策略,从而减少样本复杂度和训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00113 2026-06-04 eess.SY cs.LG cs.RO cs.SY math.OC 62%

Learning Stabilizable Dynamical Systems via Control Contraction Metrics

通过控制收缩度量学习可稳定化的动态系统

Sumeet Singh, Vikas Sindhwani, Jean-Jacques E. Slotine, Marco Pavone

机构 * Dept. of Aeronautics and Astronautics, Stanford University(航空航天系,斯坦福大学) Google Brain Robotics, New York(谷歌大脑机器人,纽约) Dept. of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种新的框架,用于学习可稳定化的非线性动态系统,以实现机器人连续控制任务。核心方法是开发一种基于稳定性的控制理论正则化器,以确保学习到的系统可以配备一个稳健的控制器,能够稳定任何系统生成的开环轨迹。通过利用收缩理论、统计学习和凸优化工具,我们提供了一个通用且可操作的半监督算法来学习可稳定化的动态系统,可以应用于复杂的欠驱动系统。在模拟平面四旋翼系统上验证了所提算法,并观察到与传统回归技术学习的模型相比,使用控制理论正则化模型在轨迹生成和跟踪性能上有显著改进,尤其是在使用少量示范示例时。结果展示了将标准基于模型的强化学习算法与非线性控制理论概念结合的必要性,以提高可靠性。

Comments To appear at WAFR 2018. v2: re-structured Sections 3 & 4 to improve clarity; expanded discussion on limitations & future work in Section 5; added details on training & validation, significantly expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.09342 2026-06-04 eess.SY cs.LG cs.RO cs.SY math.OC 62%

Optimal and Learning Control for Autonomous Robots

自主机器人最优与学习控制

Jonas Buchli, Farbod Farshidian, Alexander Winkler, Timothy Sandy, Markus Giftthaler

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文基于最优控制与强化学习,从统一视角探讨自主机器人闭环控制问题,提供统一符号和术语对比,帮助理解不同领域方法。

Comments Lecture Notes, 101 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 62%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04634 2026-06-04 cs.LG 57%

Explainably Safe Reinforcement Learning

可解释的安全强化学习

Sabine Rieder, Stefan Pranger, Debraj Chakraborty, Jan Křetínský, Bettina Könighofer

机构 * Masaryk University(马萨里克大学) Graz University of Technology(格拉茨技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 提出一种基于分层决策树的可解释安全强化学习方法,通过世界模型分析状态风险并构建屏蔽策略,生成可理解的解释,同时保持安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.11411 2026-06-04 eess.SY cs.LG cs.MA cs.SY 57%

Observer-based Adaptive Optimal Output Containment Control problem of Linear Heterogeneous Multi-agent Systems with Relative Output Measurements

基于观测器的自适应最优输出包容控制问题:线性异构多智能体系统中的相对输出测量

Majid Mazouchi, Mohammad Bagher Naghibi-Sistani, Seyed Kamal Hosseini Sani, Farzaneh Tatari, Hamidreza Modares

机构 * Department of Electrical Engineering, Ferdowsi University of Mashhad, Mashhad, Iran(马什哈德法尔多西大学电气工程系) Department of Electrical Engineering, University of Semnan, Semnan, Iran(塞姆南大学电气工程系) Missouri University of Science(密苏里科技大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种基于相对输出反馈的最优解法,用于线性异构多智能体系统的包容控制问题,通过分布式最优控制协议确保跟随器输出处于领导者输出的凸包内并优化暂态性能,采用分布式观测器估计不可用的状态和凸包。

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.06460 2026-06-04 eess.SY cs.RO cs.SY 57%

Robust Satisfaction of Temporal Logic Specifications via Reinforcement Learning

通过强化学习实现时序逻辑规范的鲁棒满足

Austin Jones, Derya Aksaray, Zhaodan Kong, Mac Schwager, Calin Belta

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出通过强化学习最大化满足信号时序逻辑规范的概率和鲁棒性,通过机器人导航仿真验证其在概率和鲁棒性上的优越性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08719 2026-06-04 eess.SY cs.SY 50%

Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing

基于深度强化学习的六自由度行星powered着陆与着陆

Brian Gaudet, Richard Linares, Roberto Furfaro

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文提出了一种新型的集成引导与控制算法,利用强化学习原理学习策略,以实现精确且燃料高效的轨迹,同时通过不同的折扣率提升优化性能。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.06491 2026-06-04 eess.SY cs.SY stat.ML 50%

Data-Efficient Reinforcement Learning with Probabilistic Model Predictive Control

基于概率模型预测控制的数据高效强化学习

Sanket Kamthe, Marc Peter Deisenroth

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出基于概率模型预测控制的强化学习框架,通过高斯过程学习转移模型以处理约束,实现数据高效和最优控制。

Comments Accepted at AISTATS 2018,

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.02441 2026-06-04 eess.SY cs.SY stat.ML 50%

A Novel Model for Arbitration between Planning and Habitual Control Systems

一种用于规划与习惯控制系统的仲裁新模型

Farzaneh S. Fard, Thomas P. Trappenberg

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出一种结合规划与习惯控制的仲裁模型,通过模拟双关节机械臂任务展示其在动态环境中的高效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09055 2026-06-04 eess.SY cs.SY 50%

Simultaneous active parameter estimation and control using sampling-based Bayesian reinforcement learning

基于采样式贝叶斯强化学习的同时主动参数估计与控制

Patrick Slade, Preston Culbertson, Zachary Sunberg, Mykel Kochenderfer

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 本文提出利用蒙特卡洛树搜索和扩展卡尔曼滤波处理高斯过程噪声和参数不确定性,实现机器人任务中的同时估计与控制,通过比较确定性等价模型预测控制的仿真结果验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.07279 2026-06-04 eess.SY cs.SY 50%

Myopic Policy Bounds for Information Acquisition POMDPs

短视策略界限用于信息获取POMDPs

Mikko Lauri, Nikolay Atanasov, George J. Pappas, Risto Ritala

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文研究了机器人传感系统在环境监测、搜索救援和侦察等场景中的自主信息采集问题,通过部分可观测马尔可夫决策过程(POMDP)建模,提出基于短视计算的策略上下界方法,用于加速最优策略的求解。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.3038 2026-06-04 eess.SY cs.SY 50%

Model-based Path Integral Stochastic Control: A Bayesian Nonparametric Approach

基于模型的路径积分随机控制:一种贝叶斯非参数方法

Yunpeng Pan, Evangelos A. Theodorou, Michail Kontitsis

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出一种基于路径积分和高斯过程的模型驱动随机优化控制框架,通过有限样本数据自主学习时间变化的最优控制,提升高维复杂任务的控制效率。

详情

展开后加载摘要…

URL PDF HTML 收藏