arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2604.19295 2026-04-22 cs.LG 83%

TEMPO: Scaling Test-time Training for Large Reasoning Models

TEMPO:用于大规模推理模型的测试时训练扩展

Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

机构 * Tianjin University(天津大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03066 2026-04-22 cs.CL cs.AI cs.LG 82%

Do LLMs Encode Functional Importance of Reasoning Tokens?

大型语言模型是否编码了推理标记的功能重要性?

Janvijay Singh, Dilek Hakkani-Tür

机构 * Grainger College of Engineering(格雷格纳工程学院) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型是否内部编码了推理标记的功能重要性,提出贪心剪枝方法,在保持模型似然的前提下剪除对答案生成影响最小的推理标记,验证了模型在压缩推理链时的功能重要性结构。

Comments Updated after ACL Main 2026 acceptance; 25 pages, 8 figures, 4 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19444 2026-04-22 cs.LG 79%

Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation

无监督的置信度校准用于推理语言模型:从单次生成出发

Thomas Zollo, Jimmy Wang, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种无监督置信度校准方法,通过单次生成数据提升推理语言模型的置信度估计,经多任务评估显著优于基线方法,提升下游任务表现。

Comments 41 pages, 14 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG 78%

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 测试时计算 :test-time compute(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19395 2026-04-22 cs.CL 77%

Does Self-Consistency Improve the Recall of Encyclopedic Knowledge?

自洽性是否能提升百科知识的回忆能力?

Sho Hoshino, Ukyo Honda, Peinan Zhang

机构 * CyberAgent

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本文通过建立MMLU基准的百科知识回忆分割,验证了自洽性在符号推理和百科知识回忆中的提升效果,使用GPT-4o达到MMLU 89%的准确率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08899 2026-04-22 cs.CL cs.LG 62%

ConFu: Contemplate the Future for Better Speculative Sampling

ConFu:为更好的推测采样展望未来

Zongyue Qin, Raghavv Goel, Mukul Gagrani, Risheek Garrepalli, Mingu Lee, Yizhou Sun

机构 * University of California Los Angeles, United States(美国加州大学洛杉矶分校) Qualcomm AI Research, United States(高通人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ConFu提出一种新的推测解码框架,通过引入展望令牌和软提示,使草案模型能利用目标模型的未来信号,提升生成速度和接受率。

Comments v3: Added stress test with long drafts (DL=12, top-k=1) and tail-acceptance (survival) analysis. Earlier versions added Qwen3-4B results and ablations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11199 2026-04-22 cs.CL cs.LG 62%

When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification

何时以及为何提问:AskBench与基于规则的强化学习与验证器(RLVR)用于LLM澄清

Jiale Zhao, Ke Fang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文研究如何评估和改进LLM在缺乏关键信息或包含误导信息时的澄清能力,提出AskBench交互基准和基于规则的强化学习与验证器(RLVR)方法,提升准确性和交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏