Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
通过排列感知GRPO缓解大语言模型中的选择偏差
机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PA-GRPO方法,通过强制排列一致的语义推理来缓解大语言模型中的选择偏差,实验显示其在七个基准测试中表现优异,有效减少偏差同时保持高性能。
Comments Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables