Improving Latent Generalization Using Test-time Compute
通过测试时间计算提升潜在泛化能力
机构 * Google DeepMind(谷歌DeepMind)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG
AI总结 本文研究如何通过测试时间计算('思考')提升语言模型的潜在泛化能力,利用强化学习训练模型生成长链思考以改进泛化,实验显示该方法在分布内知识和分布外知识上均有效,但对纯反转任务仍逊于上下文学习。