Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining
多极语义注意力:一种用于预训练的Softmax注意力快速近似方法
机构 * TU Darmstadt(达姆施塔特工业大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG
AI总结 提出多极语义注意力(MuSe),通过对查询和键分别聚类实现查询特定的摘要,在64k上下文预训练中加速36%且保持损失不变,无需架构修改,兼容现有预训练模型。