Pretraining large language models with MXFP4 on Native FP4 Hardware
使用MXFP4在原生FP4硬件上预训练大型语言模型
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究发现FP4训练不稳定主要由梯度路径的结构微缩放误差引起,通过MXFP4量化在Transformer训练中的受控研究,揭示了FP4在Fprop和Dgrad中对收敛影响较小,而Wgrad量化导致收敛退化。