arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-17 至 2026-04-17 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2411.00361 2026-04-17 cs.LG 77%

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03897 2026-04-17 cs.RO cs.AI cs.CL cs.HC cs.LG 71%

IROSA: Interactive Robot Skill Adaptation using Natural Language

IROSA: 基于自然语言的交互机器人技能适应

Markus Knauer, Samuel Bustamante, Thomas Eiband, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出IROSA框架,利用预训练大语言模型实现开放词汇技能适应,通过工具架构在语言模型与机器人硬件间保持抽象层,无需微调即可通过自然语言指令调整机器人技能。

Comments Accepted IEEE Robotics and Automation Letters (RA-L) journal, 8 pages, 5 figures, 3 tables, 1 listing. Code available: https://github.com/DLR-RM/IROSA

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 62%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20869 2026-04-17 cs.LG cs.AI 62%

Model-Based Reinforcement Learning under Random Observation Delays

基于模型的强化学习在随机观测延迟下的应用

Armin Karamzade, Kyungmin Kim, JB Lanier, Davide Corsi, Roy Fox

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学尔湾分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了POMDPs中的随机传感器延迟问题,提出了一种基于模型的过滤过程和延迟感知框架,以提升强化学习在随机延迟环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15289 2026-04-17 cs.RO 57%

Abstract Sim2Real through Approximate Information States

通过近似信息状态实现抽象sim2real

Yunfu Deng, Yuhao Li, Josiah P. Hanna

机构 * Prediction and Action Lab (PAL)(预测与行动实验室) University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了在抽象模拟器中通过强化学习训练政策并成功迁移到现实世界的问题,提出了一种利用真实任务数据修正抽象模拟器动力学的方法,实现了sim2sim和sim2real的政策迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15201 2026-04-17 cs.LG 57%

RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning

RL-STPA:将系统理论危害分析适应于安全关键强化学习

Steven A. Senczyszyn, Timothy C. Havens, Nathaniel Rice, Jason E. Summers, Benjamin D. Werner, Benjamin J. Schumeg

机构 * Michigan Technological University(密歇根技术大学) ARiA DEVCOM

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出RL-STPA框架,通过分层子任务分解、覆盖引导扰动测试和迭代检查点,系统分析强化学习中的安全风险,提升安全关键应用的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏