Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模
机构 * University of New South Wales(新南威尔士大学) ; Tencent Hunyuan(腾讯文言) ; Tencent Yuanbao(腾讯元宝) ; UESTC(电子科技大学) ; Peking University(北京大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。
Comments accepted by ACL 2026 Findings