Strong Teacher Not Needed? On Distillation in LLM Pretraining
不需要强教师?关于大语言模型预训练中的蒸馏
机构 * Princeton University(普林斯顿大学)
AI总结 本文通过构造不同强弱关系的师生模型,研究大语言模型预训练中知识蒸馏的有效性,发现弱教师也能提升学生模型,且强教师不一定更好。
高校专区
不需要强教师?关于大语言模型预训练中的蒸馏
机构 * Princeton University(普林斯顿大学)
AI总结 本文通过构造不同强弱关系的师生模型,研究大语言模型预训练中知识蒸馏的有效性,发现弱教师也能提升学生模型,且强教师不一定更好。
GENSTRAT:迈向大型语言模型中的战略推理科学
机构 * Princeton University(普林斯顿大学) ; Google(谷歌)
AI总结 提出GENSTRAT框架,通过程序化生成不完全信息博弈环境,结合能力剖面和锯齿度度量,系统评估大型语言模型的战略推理能力。
Comments 33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)
具有扩散教师的期望方差缩减
机构 * NVIDIA ; University of Toronto(多伦多大学) ; Princeton University(普林斯顿大学)
AI总结 提出CARV框架,通过分层蒙特卡洛估计器(摊销上游计算、时间步重要性采样和分层逆CDF构造)降低扩散模型作为冻结教师时的梯度方差,在文本到3D和蒸馏实验中实现2-3倍有效计算乘数。
Comments Project page: https://research.nvidia.com/labs/sil/projects/CARV/