Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models
推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法
机构 * IIIT Delhi(印度信息技术学院德里分校) ; IIT BHU(印度理工学院(巴纳拉斯印度教大学)) ; IIT Kanpur(印度理工学院坎普尔分校) ; NII Tokyo(日本国立情报学研究所) ; Microsoft Research India(微软印度研究院)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);verifier(abstract);分类 cs.AI
AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。