Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models
超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习
机构 * Seoul National University(首尔大学) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目) ; Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院) ; Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)
专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 该研究针对扩散大语言模型强化学习中在线策略 rollout 稀缺的问题,提出 ERILS 方法整合外部策略 rollout,在数独等任务上显著提升性能,验证了 rollout 构建与奖励处理的重要性。