QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides
QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习
机构 * Alibaba Inc(阿里巴巴公司)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。