OR Else: A Differentiable Trust Region for Policy Optimization
OR 否则:用于策略优化的可微信赖域
机构 * Quantiphi Inc(昆蒂菲公司) ; Self Machines Inc(自机器公司) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。
Comments 22 pages, 5 figures