Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse
注意力汇聚在注意力层中锻造原生MoE:针对头部坍塌的汇聚感知训练
机构 * Institute for Artificial Intelligence, Peking University, Beijing(人工智能研究院,北京大学,北京) ; School of Integrated Circuits, Peking University, Beijing(集成电路学院,北京大学,北京)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文通过理论和实证证明注意力汇聚自然构建了注意力层内的混合专家机制,并提出汇聚感知训练算法以缓解头部坍塌问题,提升模型性能。
Comments 2026 International Conference on Machine Learning (ICML)