Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning
架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
AI总结 提出SWARR方法,通过监督微调将预训练自注意力模型高效转换为滑动窗口注意力,并利用强化学习策略适应,缩小了与自注意力的性能差距,同时保持线性复杂度的高效性。