Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
突破探索瓶颈:面向通用大语言模型推理的Rubric引导强化学习
机构 * Zhejiang University(浙江大学) ; Li Auto Inc.(力汽车公司) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Hangzhou City University(杭州市大学)
AI总结 本文提出Rubric-Scaffolded Reinforcement Learning,通过引入检查表式评分标准作为探索和利用的指导框架,突破通用大语言模型推理的探索瓶颈,提升推理能力。