The Curse of Depth in Large Language Models
深度在大语言模型中的诅咒
机构 * Westlake University(西湖大学) ; Emory University(埃默里大学) ; Dalian University of Technology(大连理工大学) ; University of Surrey(萨里大学) ; University of Oxford(牛津大学)
AI总结 本文提出LayerNorm Scaling方法,通过缩放输出方差缓解深度诅咒,提升大语言模型的预训练和微调性能。
Comments Accepted by NeurIPS 2025