rePIRL: Learn PRM with Inverse RL for LLM Reasoning
rePIRL: 通过逆强化学习学习PRM以提高LLM推理
机构 * Meta AI ; Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系) ; Google DeepMind(谷歌DeepMind) ; Independent Researcher(独立研究者)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出rePIRL框架,通过逆强化学习学习高效的PRM,无需依赖专家策略的强假设,解决了传统方法中熵崩溃等固有限制问题,通过双学习过程和定制技术提升LLM推理性能,并在数学和编程任务数据集上验证了其有效性。