arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-24 至 2026-04-24 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2510.04573 2026-04-24 cs.LG cs.AI cs.CL 90%

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

LaDiR:潜在扩散增强大语言模型进行文本推理

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Nicklas Majamaki, Navdeep Jaitly, Yi-An Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣迭戈分校) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 LaDiR通过结合连续潜在表示的表达力与潜在扩散模型的迭代精炼能力,提升大语言模型在文本推理中的准确性、多样性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04023 2026-04-24 cs.CL 88%

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL 88%

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21593 2026-04-24 cs.CL 83%

Language as a Latent Variable for Reasoning Optimization

语言作为潜在变量用于推理优化

Linjuan Wu, Haoran Wei, Jialong Tang, Shuang Luo, Baosong Yang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨语言作为潜在变量对推理性能的影响,提出polyGRPO框架通过多语言数据优化模型,提升推理准确率和跨任务泛化能力。

Comments 17 pages, 7 figures, Under Reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21057 2026-04-24 cs.CL 79%

TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping

TRACES:用于适应性成本高效提前停止的推理步骤标记

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRACES通过实时标记推理步骤,实现大语言模型推理的适应性成本高效提前停止,通过监控特定步骤类型提升数学和知识推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00931 2026-04-24 cs.LG cs.AI 62%

Continuous-Utility Direct Preference Optimization

连续效用直接偏好优化

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zihao He, Muhammad Usman Rafique, Asad Aali, Muhammad Ali Jamshed, John M. Cioffi, Emily Fox

机构 * stanford(斯坦福大学) meta glasgow(格拉斯哥大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20712 2026-04-24 cs.LG cs.CL 62%

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

CE-GPPO:通过梯度保持剪裁策略优化协调熵在强化学习中

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Independent(独立)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CE-GPPO算法,通过恢复剪裁令牌的梯度信号,协调探索与利用,缓解熵不稳定问题,并在数学推理任务中优于现有方法。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18629 2026-04-24 cs.LG cs.AI 62%

HyperAdapt: Simple High-Rank Adaptation

HyperAdapt: 简单的高秩适应

Abel Gurung, Joseph Campbell

机构 * Purdue University(普渡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HyperAdapt通过高秩更新减少可训练参数,实现高效的微调,在多个基准测试中表现接近全微调方法。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21187 2026-04-24 math.CO cs.AI 57%

Doubly Saturated Ramsey Graphs: A Case Study in Computer-Assisted Mathematical Discovery

双重饱和的Ramsey图:计算机辅助数学发现的一个案例研究

Benjamin Przybocki, John Mackey, Marijn J. H. Heule, Bernardo Subercaseaux

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过结合SAT求解与定制生成的代码,发现无限多的双重饱和Ramsey图,回答了Grinstead和Roberts在1982年的疑问,并利用LLM生成形式化证明,展示自动化推理、大语言模型和形式验证在数学发现中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏