arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-20 至 2026-05-20 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2605.19924 2026-05-20 cs.RO 79%

RoHIL: Robust Human-in-the-Loop Robotic Reinforcement Learning Against Illumination Variations

RoHIL: 面对光照变化的鲁棒人机协同机器人强化学习

Shuoqin Zhang, Yixin Xiong, Xiru Gao, Kai Liu, Ke Wang, Xichuan Zhou, Zhe Hu

机构 * Chongqing University(重庆大学) Chengdu Anu Intelligence(成都安努智能)

专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 本文提出RoHIL框架,通过离线微调方法解决机器人在不同工作间因光照变化导致的性能下降问题,保留原始工作间性能并避免重新收集数据和训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19919 2026-05-20 cs.RO 79%

Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

超越动作残差:通过瓶颈潜在强化学习实现现实世界机器人策略引导

Dongjie Yu, Kun Lei, Zhennan Jiang, Jia Pan, Huazhe Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shanghai Qizhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 模仿学习与强化学习 :robot policy(title);manipulation(abstract);分类 cs.RO

AI总结 本文提出了一种名为Z-Perturbation Reinforcement Learning(ZPRL)的方法,通过紧凑的瓶颈潜在空间来引导预训练策略,从而提高样本效率和最终性能,同时在现实世界任务中显著提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18881 2026-05-20 cs.LG physics.flu-dyn 79%

Emergence of a Flow-Assisted Casting Strategy for Olfactory Navigation via Memory-Augmented Reinforcement Learning

气味导航中通过记忆增强强化学习的流辅助铸造策略的出现

Changxu Zhao, Dongxiao Zhao, Xin Bian, Gaojin Li

机构 * State Key Laboratory of Ocean Engineering, School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Shanghai 200240, People’s Republic of China(海洋工程国家重点实验室,海洋与土木工程学院,上海交通大学,上海200240,中华人民共和国) State Key Laboratory of Fluid Power and Mechatronic Systems, Department of Engineering Mechanics, Zhejiang University, Hangzhou 310027, People’s Republic of China(流体动力与机械系统国家重点实验室,工程力学系,浙江大学,杭州310027,中华人民共和国)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.LG

AI总结 研究通过记忆增强强化学习探讨了在动态流场中动物如何利用记忆长度和流条件优化气味搜索效率,发现智能体通过自适应调整搜索轨迹几何形状和启动铸造的浓度阈值来最大化成功概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19469 2026-05-20 cs.LG cs.AI cs.RO 67%

Sampling-Based Safe Reinforcement Learning

基于采样的安全强化学习

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于采样的安全强化学习方法,通过在有限的动力学样本集上联合施加约束,确保学习过程中的安全性,并在连续域中提供实用的安全保证,同时通过限制认知不确定性实现了高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19202 2026-05-20 cs.RO cs.AI math.OC 62%

Aerial Inspection Behaviors via RL-based Quadrotor Control for Under-canopy Forest Environments

通过基于强化学习的四旋翼控制实现空中巡检行为:在树冠下森林环境中的应用

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, Viswa Narayanan Sankaranarayanan, George Nikolakopoulos

机构 * Robotics and AI group, in the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology, Sweden(鲁尔坎大学技术学院机器人与人工智能小组,计算机科学、电气与空间工程系,瑞典)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于深度强化学习的四旋翼控制器,用于在树冠下森林环境中进行自主巡检任务,通过端到端控制策略实现巡检视角姿态跟踪,并结合旅行商问题规划器和快速随机树星规划器确保长距离任务的安全可靠部署。

Comments Submitted to 2026 IEEE 22nd International Conference on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19166 2026-05-20 cs.RO cs.LG math.OC 62%

A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions

一种通过奖励设计和终止条件实现RL基于四旋翼控制性能调优的启发式方法

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, George Nikolakopoulos

机构 * Robotics and AI group, in the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology(鲁德尼大学机器人与人工智能小组,计算机科学、电气与空间工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种新的启发式方法,通过奖励设计和终止条件实现RL四旋翼控制的可调性能,该方法通过双带宽指数奖励结构实现了设定点跟踪的临界阻尼响应,并具有低稳态误差。在使用近端策略优化(PPO)算法训练时,结合episode截断条件,在600万次时间步内以高效的方式实现了所需性能。通过直观的启发式规则调整奖励权重和指数系数,可以实现更快(空翻式)和更慢(检查式)的稳定时间性能,同时保留基线临界阻尼响应和约2%的稳态误差。

Comments Accepted in the 34th Mediterranean Conference on Control and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏