FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
FP4探索,BF16训练:通过高效的回放缩放实现扩散强化学习
机构 * NVIDIA(英伟达) ; HKU(香港大学) ; MIT(麻省理工学院)
AI总结 本文提出Sol-RL框架,通过FP4量化与BF16训练结合,提升扩散模型的对齐性能,实现训练效率与精度的平衡,实验显示在多个指标上表现优异,训练收敛速度提升4.64倍。