Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
通过视觉语言嵌入减少Oracle反馈用于基于偏好的强化学习
机构 * AWS AI Labs(AWS AI实验室)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG
AI总结 本文提出ROVED框架,结合视觉语言嵌入与针对性Oracle反馈,通过过滤机制减少不确定性样本的Oracle查询,提升鲁棒性与效率,实验证明在机器人任务中显著降低Oracle调用次数。
Comments Accepted at ICRA 2026. Project page:https://roved-icra-2026.github.io/