The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
稀疏前沿:Transformer大语言模型中稀疏注意力的权衡
机构 * University of Edinburgh(爱丁堡大学) ; Cohere ; Meta
AI总结 通过大规模实证分析,研究了六种免训练稀疏注意力方法在多个模型和任务上的效率-准确性权衡,发现稀疏注意力有效、细粒度预填充不实用、长序列容忍更高稀疏度。
高校专区
稀疏前沿:Transformer大语言模型中稀疏注意力的权衡
机构 * University of Edinburgh(爱丁堡大学) ; Cohere ; Meta
AI总结 通过大规模实证分析,研究了六种免训练稀疏注意力方法在多个模型和任务上的效率-准确性权衡,发现稀疏注意力有效、细粒度预填充不实用、长序列容忍更高稀疏度。