ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
ConsistRM:通过一致性感知自训练改进生成奖励模型
机构 * Baidu Inc.(百度公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ConsistRM框架,通过一致性感知答案奖励和批评奖励提升生成奖励模型的稳定性与一致性,实验表明其在五个基准数据集上优于传统强化微调方法。
Comments Published as a Main conference paper at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)