arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-21 至 2026-08-21 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4 篇

2601.10930 2026-08-21 cs.RO 版本更新 79%

Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation

何处触碰,如何接触:面向几何感知的长时间灵巧操作的分层RL-MPC框架

Zhixian Xie, Yu Xiang, Michael Posa, Wanxin Jin

机构 * Arizona State University(亚利桑那州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出分层RL-MPC框架,高层RL策略预测接触意图(接触位置和子目标位姿),低层接触隐式MPC优化局部接触模式并实时重规划,实现几何泛化的非抓取操作,数据效率提升10倍且零样本迁移到真实环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19684 2026-08-21 cs.AI cs.LG cs.RO 新提交 67%

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

利用离线质量多样性强化学习学习分层技能策略

Tanachai Anakewat, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究提出QDOS算法,通过优势加权质量多样性预训练与双数据集复用策略,在分层技能学习框架下,于稀疏奖励任务中显著提升性能,优于强基线算法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-21 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-21 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: this https URL (https://zanette-labs.github.io/MaxRL/)

详情

展开后加载摘要…

URL PDF HTML 收藏