Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models
重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Tongyi Lab(通义实验室) ; Northeastern University(东北大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。