Revisiting the Adam-SGD Gap in LLM Pre-Training: The Role of Large Effective Learning Rates
重新审视LLM预训练中Adam与SGD的差距:大有效学习率的作用
机构 * University of Minnesota(明尼苏达大学)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文通过实证和理论分析,发现SGD在LLM预训练中表现较差的原因在于其无法维持与Adam相媲美的有效学习率,而大有效学习率需求源于小梯度范数和大权重-梯度比,且在大批次大小下更加明显。通过简单剪枝机制,SGD在大学习率下能恢复大部分Adam性能,实验显示验证损失差距从超过50%降至约3.5%。