arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-04 至 2026-05-04 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2605.00347 2026-05-04 cs.LG cs.AI cs.CL 62%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 62%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00384 2026-05-04 cs.RO 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 57%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04341 2026-05-04 cs.LG 57%

Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism

长周期基于模型的离线强化学习无需显式保守性

Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出NEUBAY算法,通过贝叶斯方法解决长周期rollout中的价值过估计问题,在D4RL和NeoRL基准上取得新进展。

Comments ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay

详情

展开后加载摘要…

URL PDF HTML 收藏