Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
基于数据的探索:面向人类反馈的在线强化学习
机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) ; Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) ; Northeastern University(东北大学) ; Zhejiang Gongshang University(浙江工商大学)
AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。