Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期
机构 * Startlux(星创公司) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Hong Kong(香港大学) ; University of Sydney(悉尼大学) ; Columbia University(哥伦比亚大学)
AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。
Comments Under review