Why Do Accumulated Transformations Extrapolate?
为什么累积变换能够外推?
机构 * A Carrot, Inc.(A Carrot公司)
AI总结 本文研究累积正交变换(如Householder反射或SO(2)旋转)在注意力机制中产生长度外推能力的原理,证明其通过有限步后去相干性抑制远距离token,并指出其最终会退化,而旋转值可扩展有效范围。
Comments 33 pages, submitted to TMLR
期刊&会议
Transactions on Machine Learning Research · 期刊 · Machine Learning
为什么累积变换能够外推?
机构 * A Carrot, Inc.(A Carrot公司)
AI总结 本文研究累积正交变换(如Householder反射或SO(2)旋转)在注意力机制中产生长度外推能力的原理,证明其通过有限步后去相干性抑制远距离token,并指出其最终会退化,而旋转值可扩展有效范围。
Comments 33 pages, submitted to TMLR
不要破坏我的LLM:剪枝注意力层对解释忠实性和置信度校准的影响
机构 * University of Copenhagen(哥本哈根大学) ; LUT University(拉赫蒂理工大学)
AI总结 研究剪枝LLM注意力层对解释忠实性和置信度校准的影响,发现尽管准确率保持,但忠实性和校准度常下降,表明模型置信度、可解释性与准确性之间存在错位。
Comments Accepted at TMLR