arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-30 至 2026-03-30 共收录 2 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 2 篇

2603.26666 2026-03-30 cs.RO 70%

VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation

VLA-OPD: 通过在线策略蒸馏连接离线SFT与在线RL以构建视觉-语言-动作模型

Zhide Zhong, Haodong Yan, Junfeng Li, Junjie He, Tianran Zhang, Haoang Li

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出VLA-OPD框架,通过在线策略蒸馏结合离线SFT与在线RL,解决预训练模型在部署中的分布偏移和灾难性遗忘问题,提升样本效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26467 2026-03-30 cs.RO 57%

Addressing Ambiguity in Imitation Learning through Product of Experts based Negative Feedback

通过专家产品负反馈解决模仿学习中的歧义

John Bateman, Andy M. Tyrrell, Jihong Zhu

机构 * University of York(约克大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种利用次优示范解决歧义任务的系统,通过自身失败学习,显著提升成功率,优于传统正反馈模仿学习,且在效能和效率上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏