arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1 篇

2604.01430 2026-04-03 cs.LG 83%

Improving Latent Generalization Using Test-time Compute

通过测试时间计算提升潜在泛化能力

Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文研究如何通过测试时间计算('思考')提升语言模型的潜在泛化能力,利用强化学习训练模型生成长链思考以改进泛化,实验显示该方法在分布内知识和分布外知识上均有效,但对纯反转任务仍逊于上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏