Training Dynamics of Softmax Self-Attention: Fast Global Convergence via Preconditioning
softmax自注意力层的训练动态:通过预条件实现快速全局收敛
机构 * Simons Institute, UC Berkeley(西蒙斯研究所,伯克利大学) ; Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学)
AI总结 本文提出了一种结构感知的梯度下降算法,通过预条件和谱初始化实现softmax自注意力层在有限数据下的快速全局收敛。