StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹
机构 * Beihang University, Beijing, China(北京航空航天大学) ; Peking University, Beijing, China(北京大学) ; Zhongguancun Laboratory, Beijing, China(中关村实验室) ; King's College London, United Kingdom(伦敦国王学院)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。