arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-29 至 2026-04-29 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2604.25039 2026-04-29 cs.CL cs.AI 92%

Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

双轨CoT:面向小语言模型的预算感知逐步引导

Sagnik Chatterjee, Atharva Patil, Sricharan Ramesh

专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 88%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 79%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25634 2026-04-29 cs.CR cs.CL 57%

The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive

大语言模型输出的令人惊讶的普遍性:一种实时验证原语

Alex Bogdan, Adrian de Valois-Franklin

机构 * Evolutionairy AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型输出的词频分布符合Mandelbrot分布,提出一种无需GPU的快速验证方法,用于模型指纹识别和黑盒输出评估。

Comments 25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference

详情

展开后加载摘要…

URL PDF HTML 收藏