arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-04 至 2026-03-04 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2509.16858 2026-03-04 cs.RO 70%

Towards an Adaptive Social Game-Playing Robot: An Offline Reinforcement Learning-Based Framework

迈向自适应社交游戏机器人:一种基于离线强化学习的框架

Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

机构 * Department of Mechanical Engineering, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校机械工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于离线强化学习的自适应社交游戏机器人框架,通过整合多模态情绪识别与自适应响应,提升机器人在游戏场景中对用户情绪的适应能力。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01741 2026-03-04 cs.LG cs.AI cs.RO 67%

Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning

重新思考大规模强化学习中集成策略梯度中的策略多样性

Naoki Shitanda, Motoki Omura, Tatsuya Harada, Takayuki Osa

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出耦合策略优化方法,通过KL约束调节策略多样性,提升大规模强化学习中的探索效率和学习性能。

Comments In ICLR 2026. Website at https://naoki04.github.io/paper-cpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02783 2026-03-04 cs.RO cs.LG cs.MA 66%

Generative adversarial imitation learning for robot swarms: Learning from human demonstrations and trained policies

生成对抗模仿学习在机器人群体中的应用:从人类示范和训练策略中学习

Mattes Kraus, Jonas Kuckling

专题命中 模仿学习与强化学习 :robotics(abstract,comments);分类 cs.RO、cs.LG

AI总结 本文提出基于生成对抗模仿学习的框架,从人类示范和训练策略中学习机器人群体的集体行为,并在真实机器人上验证了其有效性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18817 2026-03-04 cs.RO cs.LG 62%

Learning Acrobatic Flight from Preferences

从偏好学习空中杂技飞行

Colin Merk, Ismail Geles, Jiaxu Xing, Angel Romero, Giorgia Ramponi, Davide Scaramuzza

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出REC框架,通过基于置信度的奖励集合方法,在空中杂技飞行中实现88.4%的奖励性能,优于传统方法的55.2%,并验证其在连续控制中的广泛适用性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20071 2026-03-04 cs.LG 57%

Distributional value gradients for stochastic environments

分布价值梯度用于随机环境

Baptiste Debes, Tinne Tuytelaars

机构 * PSI KU Leuven(KU莱顿心理学研究所)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出分布式Sobolev训练方法,通过建模价值函数及其梯度的分布,提升在随机环境中的样本效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00798 2026-03-04 cs.LG stat.ML 57%

Combinatorial Rising Bandits

组合上升老虎机

Seockbean Song, Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出组合上升老虎机框架和CRUCB算法,解决组合老虎机中因基础臂增强传播导致的依赖问题,通过理论分析和实验验证其高效性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏