KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
KV-PRM:通过KV缓存转移实现高效的过程奖励建模以进行多智能体测试时扩展
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Imperial College London(伦敦帝国理工学院) ; City University of Hong Kong(香港城市大学)
AI总结 研究针对现有基于文本的过程奖励模型在长多智能体展开中评分成本高的问题,提出KV-PRM,通过读取KV缓存降低评分成本,经理论证明和实验验证,该模型在多基准测试及多种TTS方法下表现优异,大幅减少计算资源消耗。