arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2603.02091 2026-03-03 cs.LG cs.AI cs.CL 82%

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG 82%

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05004 2026-02-16 cs.LG cs.AI cs.CL 82%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02301 2026-02-11 cs.CL cs.AI cs.LG 82%

Advancing General-Purpose Reasoning Models with Modular Gradient Surgery

通过模块化梯度手术提升通用推理模型

Min Cai, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Xi Ye, Daiting Shi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过模块化梯度手术提升通用推理模型,解决跨领域训练中的梯度冲突问题,提升多任务RL性能。

Comments Preprint; Code: https://github.com/StringNLPLAB/MGS Website: https://modular-gradient-surgery.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02842 2026-02-04 cs.AI cs.CL cs.LG 82%

Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing

模拟链:一种用于大语言模型的双模式推理框架,具有动态问题路由

Saeid Sheikhi

机构 * Faculty of Information Technology(信息科技学院) Electrical Engineering University of Oulu, Oulu, Finland, 90014(奥卢大学电气工程学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoS是一种双模式推理框架,通过动态问题路由提升大语言模型的推理能力,实现更高效的准确性和效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00983 2026-02-03 cs.CL cs.AI cs.LG 82%

DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning

DISPO:提升大型语言模型数学推理中的训练效率和稳定性

Batuhan K. Karaman, Aditya Rawal, Suhaila Shakiah, Mohammad Ghavamzadeh, Mingyi Hong, Arijit Biswas, Ruida Zhou

机构 * Cornell University(康奈尔大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DISPO通过分离正确与错误响应的重要性采样权重裁剪,实现训练效率与稳定性的平衡,提升大型语言模型在数学推理任务中的性能。

Comments This work is accepted to the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14888 2026-01-22 cs.LG cs.AI cs.CL 82%

What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study

是什么使低比特量化感知训练在推理大语言模型中有效?一项系统研究

Keyu Lv, Manyi Zhang, Xiaobo Xia, Jingchen Ni, Shannan Yan, Xianzhi Yu, Lu Hou, Chun Yuan, Haoli Bai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过系统分析揭示了低比特量化感知训练在推理大语言模型中的有效性,提出优化工作流Reasoning-QAT,显著提升精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL 82%

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG 82%

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23129 2025-12-24 cs.LG cs.AI cs.CL 82%

C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning

C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理

Haotian Liu, Shuo Wang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tsinghua University(清华大学) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 C$^2$GSPG通过置信度校准群体序列策略梯度方法提升推理性能并抑制过度自信,适用于逻辑和数学推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02324 2025-12-23 cs.CL cs.AI cs.LG 82%

PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models

PromptCoT: 为大型语言模型中的数学推理合成竞赛级问题

Xueliang Zhao, Wei Wu, Jian Guan, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PromptCoT通过模拟竞赛级问题设计者的思维过程,自动生成高质量数学问题,提升大型语言模型的数学推理能力。

Comments Preprint

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10532 2025-12-18 cs.LG cs.AI cs.CL 82%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 82%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05033 2025-12-10 cs.CL cs.AI cs.LG 82%

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

套利:通过优势感知投机实现高效推理

Monishwaran Maheswaran, Rishabh Tiwari, Yuezhou Hu, Kerem Dilmen, Coleman Hooper, Haocheng Xi, Nicholas Lee, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(伯克利大学) Apple(苹果公司) ICSI(信息与计算科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Arbitrage通过动态路由机制提升步骤级投机生成的效率和准确性,减少推理延迟。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20561 2025-12-09 cs.LG cs.AI cs.CL stat.ML 82%

Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning

超越马尔可夫:通过贝叶斯自适应强化学习实现LLM推理的反思探索

Shenao Zhang, Yaqing Wang, Yinxiao Liu, Tianqi Liu, Peter Grabowski, Eugene Ie, Zhaoran Wang, Yunxuan Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过贝叶斯自适应强化学习实现LLM推理的反思探索,提升测试性能与令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20745 2025-12-09 cs.CV 82%

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

数学视觉盲:图示理解的失败削弱了多模态大语言模型的推理能力

Yanpeng Sun, Shan Zhang, Wei Tang, Aotian Chen, Piotr Koniusz, Kai Zou, Yuan Xue, Anton van den Hengel

机构 * Ohio State University(俄亥俄州立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本研究发现多模态大语言模型在图示理解上的缺陷导致推理能力下降,通过改进图示感知可显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08833 2025-12-05 cs.CL cs.AI cs.LG 82%

An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems

对LLMs在数学推理中鲁棒性的调查:通过高级数学问题的数学等价转换进行基准测试

Yuren Hao, Xiang Wan, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois Urbana–Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science Stanford University(计算机科学系斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种新的评估方法,通过数学等价转换的变体测试LLMs的数学推理鲁棒性,发现模型在不同变体上的表现差异显著。

Comments 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14495 2025-12-01 cs.CL cs.AI cs.LG 82%

Temporal Consistency for LLM Reasoning Process Error Identification

LLM推理过程错误识别中的时序一致性

Jiacheng Guo, Yue Wu, Jiahao Qiu, Kaixuan Huang, Xinzhe Juan, Ling Yang, Mengdi Wang

机构 * Department of Electrical & Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) AI Lab, Princeton University(普林斯顿大学人工智能实验室) Department of Computer Science & Engineering, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于时序一致性的LLM推理过程错误识别方法,通过迭代自我反思提升验证准确性,在多个基准测试中实现了优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17577 2025-11-25 cs.LG cs.AI cs.CL 82%

Efficient Mathematical Reasoning Models via Dynamic Pruning and Knowledge Distillation

通过动态剪枝和知识蒸馏实现高效的数学推理模型

Fengming Yu, Qingyu Meng, Haiwei Pan, Kejia Zhang

机构 * Harbin Engineering University(哈尔滨工程大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过动态剪枝和知识蒸馏优化方法,提升大型语言模型在数学推理任务中的效率与性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22411 2025-11-18 cs.LG cs.AI cs.CL 82%

Mitigating Overthinking in Large Reasoning Models via Manifold Steering

Yao Huang, Huanran Chen, Shouwei Ruan, Yichi Zhang, Xingxing Wei, Yinpeng Dong

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究所) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10850 2025-11-17 cs.CL cs.AI cs.LG 82%

Leveraging Parameter Space Symmetries for Reasoning Skill Transfer in LLMs

Stefan Horoi, Sangwoo Cho, Supriyo Chakraborty, Shi-Xiong Zhang, Sambit Sahu, Guy Wolf, Genta Indra Winata

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Capital One(Capital One公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15311 2025-11-13 cs.LG cs.AI cs.CL 82%

Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning

Yurun Yuan, Fan Chen, Zeyu Jia, Alexander Rakhlin, Tengyang Xie

机构 * UW-Madison(威斯康星大学麦迪逊分校) MIT(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21600 2025-11-06 cs.CL cs.AI cs.LG cs.PF 82%

R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing

Tianyu Fu, Yi Ge, Yichen You, Enshu Liu, Zhihang Yuan, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15207 2025-11-05 cs.LG cs.AI cs.CL 82%

FlowRL: Matching Reward Distributions for LLM Reasoning

Xuekai Zhu, Daixuan Cheng, Dinghuai Zhang, Hengli Li, Kaiyan Zhang, Che Jiang, Youbang Sun, Ermo Hua, Yuxin Zuo, Xingtai Lv, Qizheng Zhang, Lin Chen, Fanghao Shao, Bo Xue, Yunchong Song, Zhenjie Yang, Ganqu Cui, Ning Ding, Jianfeng Gao, Xiaodong Liu, Bowen Zhou, Hongyuan Mei, Zhouhan Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Stanford University(斯坦福大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00509 2025-11-04 cs.AI cs.CL cs.LG 82%

Recitation over Reasoning: How Cutting-Edge Language Models Can Fail on Elementary School-Level Reasoning Problems?

Kai Yan, Yufei Xu, Zhengyin Du, Xuesong Yao, Zheyu Wang, Xiaowen Guo, Jiecao Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 3 figures, 13 tables. The paper is accepted at AACL-IJCNLP 2025 (main track), and the latest version adds modifications in camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03865 2025-11-03 cs.LG cs.AI cs.CL 82%

Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration

Wenhao Deng, Long Wei, Chenglei Yu, Tailin Wu

机构 * Westlake University(西湖大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25206 2025-10-30 cs.AI cs.CL cs.LG 82%

RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models

Tianqianjin Lin, Xi Zhao, Xingyao Zhang, Rujiao Long, Yi Xu, Zhuoren Jiang, Wenbo Su, Bo Zheng

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22453 2025-10-28 cs.CL cs.AI cs.CV cs.LG 82%

First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training

Lai Wei, Yuting Li, Chen Wang, Yue Wang, Linghe Kong, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15238 2025-10-28 cs.CL cs.AI cs.LG cs.MA 82%

Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks

Gregory Kang Ruey Lau, Wenyang Hu, Diwen Liu, Jizhuo Chen, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP(SAP公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08325 2025-10-22 cs.AI cs.CL cs.LG 82%

Beyond Pass@k: Breadth-Depth Metrics for Reasoning Boundaries

Marius Dragoi, Ioana Pintilie, Florin Gogianu, Florin Brad

机构 * Bitdefender(Bitdefender公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 3 figures. v2 adds discussion of related work (G-Pass@k)

详情

展开后加载摘要…

URL PDF HTML 收藏