REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning
REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收
机构 * vivo AI Lab(vivo人工智能实验室) ; Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)
AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。