arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-18 至 2026-05-18 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2605.15559 2026-05-18 cs.RO 83%

NavRL++: A System-Level Framework for Improving Sim-to-Real Transfer in Reinforcement Learning-Based Robot Navigation

NavRL++: 一种提升基于强化学习的机器人导航仿真到现实迁移的系统级框架

Zhefan Xu, Hanyu Jin, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出NavRL++框架,通过系统性研究仿真到现实迁移的关键因素,引入感知鲁棒性增强策略和基于Transformer的时序推理策略,提升机器人导航性能。

Comments 18 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15769 2026-05-18 cs.RO cs.AI 73%

Lamarckian Inheritance in Dynamic Environments: How Key Variables Affect Evolutionary Dynamics

动态环境中的拉马克继承:关键变量如何影响进化动态

K. Ege de Bruin, Kyrre Glette, Kai Olav Ellefsen

机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院) RITMO, University of Oslo, Norway(奥斯陆大学RITMO)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究动态环境中关键变量对进化动态的影响,通过虚拟软机器人和两种学习方法,发现拉马克继承在环境变化冲突且不可预测时表现欠佳,但添加环境感知传感器可恢复其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19128 2026-05-18 cs.LG cs.AI 73%

Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach

在强化学习中塑造稀疏奖励:一种半监督方法

Wenyun Li, Wenjie Huang, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系) Musketeers Foundation Institute of Data Science, HKU(穆斯克特基金会数据科学研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种半监督方法,通过利用非零奖励转移和数据增强学习轨迹空间表示,提升稀疏奖励下的奖励塑造效果,在Atari和机器人操控任务中优于监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08052 2026-05-18 cs.RO cs.LG 62%

An Introduction to Deep Reinforcement and Imitation Learning

深度强化学习与模仿学习入门

Pedro Santana

机构 * ISCTE – University Institute of Lisbon(里斯本大学理工学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文介绍深度强化学习和深度模仿学习在具身智能体中的应用,涵盖马尔可夫决策过程、REINFORCE和PPO等核心算法,以及行为克隆、DAgger和GAIL等基础方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15509 2026-05-18 cs.LG cs.RO 62%

parallelcbf: A composable safety-filter and auditability framework for tensor-parallel reinforcement learning

parallelcbf:一种用于张量并行强化学习的可组合安全性过滤和可追溯性框架

Yijun Lu, Zilei Yang, Yuyin Ma

机构 * Xinjiang Key Laboratory of Intelligent Computing and Smart Applications(新疆智能计算与智能应用重点实验室) School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院,中国乌鲁木齐) School of Computing Science, Waseda University, Tokyo, Japan(早稻田大学计算机科学系,日本东京)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 ParallelCBF首次整合了张量并行无人机环境、硬门CBF安全过滤器、分片BC到RL流水线和第一类操作可追溯性,提供可组合的API以实现端到端安全约束训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04539 2026-05-18 cs.LG cs.RO 62%

FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control

FlashSAC: 高维机器人控制中的快速稳定离线强化学习

Donghu Kim, Youngdo Lee, Minho Park, Kinam Kim, I Made Aswin Nahendra, Takuma Seno, Sehee Min, Daniel Palenicek, Florian Vogt, Danica Kragic, Jan Peters, Jaegul Choo, Hojoon Lee

机构 * KTH Royal Institute of Technology(皇家理工学院) German Research Center for AI (DFKI)(德国人工智能研究中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 FlashSAC基于Soft Actor-Critic提出快速稳定的离线强化学习算法,通过减少梯度更新并增大模型规模和数据吞吐量,在高维任务中超越PPO和强离线基线,显著提升训练效率和性能。

Comments RSS'26

详情

展开后加载摘要…

URL PDF HTML 收藏