Smooth Scaling Laws Hide Stepwise Token Learning
平滑缩放定律隐藏了逐步的令牌学习
机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua university(清华大学)
AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。
Comments 21 pages