Simple Policy Gradients for Reasoning with Diffusion Language Models
为扩散语言模型进行推理的简单策略梯度
机构 * Stanford University(斯坦福大学)
AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。
Comments 19 pages. ICML 2026
高校专区
为扩散语言模型进行推理的简单策略梯度
机构 * Stanford University(斯坦福大学)
AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。
Comments 19 pages. ICML 2026