Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum
方差自适应缪子:通过NSR调制和方差缩放的动量加速大语言模型预训练
机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出缪子-NSR和缪子-VS两种方法,通过方差自适应归一化和NSR调制或方差缩放,加速大语言模型预训练,提升收敛速度并降低验证损失。