Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent
两种学习速度:Grokking 和双下降的表征-读出分解
机构 * Center for Computational Neuroscience(计算神经科学中心) ; Flatiron Institute(Flatiron研究所) ; Department of Physics(物理系) ; Harvard University(哈佛大学) ; Kempner Institute(Kempner研究所) ; New York University(纽约大学)
AI总结 通过将学习动态分解为编码器中的表征学习和最终分类器中的读出校准两个竞争过程,解释了 grokking 和 epoch-wise 双下降现象,并提供了诊断虚假泛化的框架。