Depth-Attention: Cross-Layer Value Mixing for Language Models
深度注意力:语言模型的跨层值混合
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Sun Yat-sen University(中山大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 提出深度注意力机制,在注意力模块内部实现跨层值混合,无需额外参数和推理状态,提升语言模型性能。
Comments 21 pages, 4 figures, 9 tables