Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience
支持约束强化学习实现无需真实世界经验的真实世界策略改进
机构 * University of Washington(华盛顿大学) ; Amazon FAR(亚马逊FAR)
AI总结 提出SCORE框架,通过流导向约束模拟中的强化学习到真实数据预训练生成策略的支持集,实现无需真实世界经验即可改进真实世界操作策略,在八项灵巧操作任务中成功率从37.8%提升至89.9%。
Comments 35 pages, 23 figures