Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws
数据受限的语言模型预训练:改进的正则化与缩放定律
机构 * University of Michigan(密歇根大学) ; KAIST AI(韩国科学技术院人工智能研究所)
AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。