Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
遮蔽自回归变分加速:快速推理使强化学习实用
机构 * Peking University(北京大学) ; Rice University(Rice大学) ; hi-lab, Xiaohongshu Inc(小红书实验室,小红书公司)
AI总结 本文提出MARVAL框架,通过压缩扩散链为单步自回归生成,提升推理效率并使强化学习实用化,实现了生成模型的快速采样和偏好对齐。