arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-27 至 2026-04-27 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2604.22074 2026-04-27 cs.CL 85%

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

结果奖励并不能保证可验证或因果重要的推理

Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文通过实验发现,尽管RLVR提升了任务准确率,但并未可靠提升推理的因果重要性和充分性,通过预训练可改善此问题,辅助奖励能进一步提升推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06019 2026-04-27 cs.CL cs.LG 62%

Multi-Token Prediction via Self-Distillation

通过自蒸馏实现多token预测

John Kirchenbauer, Abhimanyu Hans, Brian Bartoldson, Micah Goldblum, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Columbia University(哥伦比亚大学) TogetherAI

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过自蒸馏将预训练的自回归语言模型转换为快速独立的多token预测模型,无需额外辅助模型或复杂管道,实现更快的解码速度和更高的准确性。

Comments 9 pages and 5 figures in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏