Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
用于人类反馈强化学习的元学习奖励塑形
专题命中 偏好对齐 :RLHF(summary_cn,abstract);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG
AI总结 MeRLa是元学习的任务感知奖励塑形框架,在RLHF训练前通过辅助任务元学习塑形函数,可提升LLaMA-3-8B在多基准上的对齐性能,降低训练不稳定性。