Learning More from Less: Reinforcement Learning from Hindsight
从更少中学习更多:事后诸葛亮式强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Stanford University(斯坦福大学) ; University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。