Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
理解并改进层次稀疏注意力模型中的长度泛化
机构 * Fudan University(复旦大学) ; Tencent AI Lab(腾讯AI实验室) ; Cornell University(康奈尔大学) ; Ant Group(蚂蚁集团) ; Ant International(蚂蚁国际) ; NYU Shanghai(纽约大学上海分校)
AI总结 本文通过系统分析揭示了层次稀疏注意力模型中长度泛化的核心设计原则,提出三种关键组件:非线性Chunk编码器、旁路残差路径和预训练中的稀疏选择,从而在RULER和BABILong数据集上实现了免训练的长度外推。
Comments ICLR 2026 camera-ready version