DySCO: Dynamic Attention-Scaling Decoding for Long-Context Language Models
DySCO:动态注意力缩放解码用于长上下文语言模型
机构 * Princeton Language and Intelligence, Princeton University(普林斯顿语言与智能,普林斯顿大学) ; Department of Computer Science, New York University(纽约大学计算机科学系)
AI总结 DySCO通过动态调整注意力机制提升长上下文推理能力,利用检索头识别关键token并增强其权重,在多个基准测试中取得25%的性能提升。