Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers
Muon训练的Transformer中表示-读出接口的后顿悟崩溃
机构 * Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所) ; Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; CentraleSupélec(中央高等电力学院)
AI总结 该研究发现Muon训练的Transformer在模块化加法等任务中,顿悟后会因表示-读出接口故障丧失泛化性,冻结嵌入/读出可避免,傅里叶滤波能分离故障与掩码,任务对齐族可恢复性能。
Comments 34 pages, 6 figures, 20 tables. Full technical version; a condensed 9-page version is currently under review. Code: https://github.com/Na00s/muon-grokking