A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
对过程奖励模型的调查:从结果信号到大语言模型的过程监督
机构 * Shanghai Jiao Tong University(上海交通大学) ; University College London(伦敦大学学院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Bristol(布里斯托大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI
AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。