BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization
BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。
Comments Accepted to Findings of the ACL