Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
面向增强大语言模型推理能力的分层多步奖励模型
机构 * the University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; Renmin University of China(中国人民大学) ; the Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。