arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-09 至 2026-07-09 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 3 篇

2607.07252 2026-07-09 cs.LG cs.RO 新提交 62%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05296 2026-07-09 cs.RO cs.LG 版本更新 62%

Latent Policy Steering through One-Step Flow Policies

通过一步流策略实现潜在策略引导

Hokyun Im, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Latent Policy Steering (LPS),通过一步流策略实现高保真的潜在策略改进,解决了离线强化学习中回报最大化与行为约束之间的权衡问题,实现了无需复杂超参数调整的鲁棒性能。

Comments Accepted to RSS 2026, Project Webpage : https://jellyho.github.io/LPS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13879 2026-07-09 cs.LG 版本更新 57%

Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

李普希茨正则化评论家导致策略对转移动态不确定性具有鲁棒性

Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

机构 * College of Engineering & Computer Science, Syracuse University(工程与计算机科学学院,苏利文大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 研究针对强化学习中转移动态不确定性致策略性能下降问题,提出基于近端策略优化的PPO-PGDLC算法,集成投影梯度下降与李普希茨正则化评论家,实验表明该算法在环境扰动下性能更好且动作更平滑。

Journal ref Vol. 39 No. 1 (2026): Proceedings of FLAIRS-39

详情

展开后加载摘要…

URL PDF HTML 收藏