arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-10 至 2026-07-10 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 3 篇

2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 81%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01838 2026-07-10 cs.LG cs.AI 76%

Goal-Conditioned Reinforcement Learning for Data-Driven Maritime Navigation

面向数据驱动的航海导航的基于目标的强化学习

Vaishnav Vaidheeswaran, Dilith Jayakody, Samruddhi Mulay, Anand Lo, Md Mahbub Alam, Gabriel Spadon

机构 * Faculty of Computer Science(计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.AI、cs.LG

AI总结 本文提出基于目标的强化学习方法,用于数据驱动的航海导航,通过多离散动作空间学习优化路线,结合动作掩码与正向奖励提升策略性能。

Journal ref IEEE International Conference on Big Data (BigData), 2025, pp. 1194-1203

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15136 2026-07-10 cs.LG cs.AI 版本更新 62%

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

安全流Q学习:基于可达性的安全离线强化学习流策略

Mumuksh Tayal, Manan Tayal, Ravi Prakash

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Safe Flow Q-Learning,结合达性启发的安全价值函数和高效的一步流策略,通过自一致性Bellman递归学习安全价值,行为克隆训练流策略并转化为奖励最大化安全动作选择器,减少部署时的拒绝采样,提升实时安全应用性能。

Comments 21 pages, 6 figures, 3 tables; First 2 authors have contributed equally; Paper accepted at Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏