Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
直接推理优化:基于推理反射的令牌级推理与评分门控用于不可验证任务
机构 * Microsoft(微软公司) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种约束强化学习框架,通过令牌级推理反射奖励和评分门控优化不可验证任务的推理质量与学习效率。