ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation
ConSA: 通过可学习分配实现混合注意力中的可控稀疏性
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; Baidu Inc.(百度公司)
AI总结 提出ConSA框架,通过L0正则化和增广拉格朗日约束学习全注意与滑动窗口注意的最优分配,实现用户指定的稀疏目标,在0.6B和1.7B规模LLM上优于规则基线,并发现底层SWA与中层FA的集中分配模式。