LoopRPT: Reinforcement Pre-Training for Looped Language Models
LoopRPT: 用于循环语言模型的强化预训练
机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) ; Tsinghua University, Beijing, China(清华大学) ; The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)
AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。