Mask-Aware Policy Gradients for Diffusion Language Models
用于扩散语言模型的掩码感知策略梯度
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。
Comments Accepted at COLM 2026