arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2604.02819 2026-04-06 cs.CL 85%

Student-in-the-Loop Chain-of-Thought Distillation via Generation-Time Selection

通过生成时间选择的学生在环链式思维蒸馏

Chaoqun He, Yingfa Chen, Chaojun Xiao, Xu Han, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出Gen-SSD框架,通过生成时间选择提升链式思维蒸馏效果,实验显示其在数学推理基准上优于传统知识蒸馏和其他基线方法。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28204 2026-04-06 cs.LG cs.AI 81%

ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models

ERPO:基于熵调节的策略优化用于大推理模型

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ERPO通过引入熵感知门控、桶式隐式归一化和结果锚定优势合成,解决大语言模型中因统一优势信号导致的探索不足问题,提升推理准确性和路径简洁性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02450 2026-04-06 cs.LG cs.AI cs.CL 75%

Do We Need Frontier Models to Verify Mathematical Proofs?

我们是否需要前沿模型来验证数学证明?

Aaditya Naik, Guruprerana Shabadi, Rajeev Alur, Mayur Naik

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了开源和前沿LLM在验证数学证明中的表现,发现较小模型在准确性上接近前沿模型,但一致性较差,通过定制提示词提升性能。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏