arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2510.01037 2026-03-24 cs.LG cs.AI 84%

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

CurES:从梯度分析到高效课程学习以提升推理大语言模型

Yongcheng Zeng, Zexu Sun, Bokai Ji, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Haifeng Zhang, Xu Chen, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baidu Inc.(百度公司) University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CurES方法,通过梯度优化理论分析,改进大语言模型推理任务的训练效率,实验显示其在多个数学推理基准上优于现有方法。

Comments 25 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18886 2026-03-20 cs.AI cs.CL 84%

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

数学对象推理:在线奖励建模与测试时间聚合

Pranjal Aggarwal, Marjan Ghazvininejad, Seungone Kim, Ilia Kulikov, Jack Lanchantin, Xian Li, Tianjian Li, Bo Liu, Graham Neubig, Anaelia Ovalle, Swarnadeep Saha, Sainbayar Sukhbaatar, Sean Welleck, Jason Weston, Chenxi Whitehouse, Adina Williams, Jing Xu, Ping Yu, Weizhe Yuan, Jingyu Zhang, Wenting Zhao

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16206 2026-03-18 cs.LG cs.CL 84%

Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning

离线探索感知微调用于长链数学推理

Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室,中国沈阳) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯公司微信人工智能部门模式识别中心,中国)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出OXA微调方法,通过优化两个目标提升数学推理能力,实验显示在六个基准测试中OXA相比传统SFT在Pass@1和Pass@$k$上平均提升6和5分。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09184 2026-03-11 cs.LG cs.AI 84%

Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning

Latent-DARM: 联结离散扩散与自回归模型以实现推理

Lina Berrayana, Ahmed Heakl, Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Latent-DARM通过结合离散扩散模型与自回归模型,提升多智能体系统在推理任务中的表现和协作效率。

Comments Published at LIT Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI 84%

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05850 2026-02-24 cs.CL cs.AI 84%

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 84%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 84%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03950 2026-02-10 cs.AI cs.LG cs.MA 84%

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

通过执行驱动推理增强提升大语言模型的数学问题解决能力

Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出IIPC方法,通过迭代优化程序推理链并结合执行反馈,提升大语言模型的数学问题解决能力。

Comments 9 pages, 7 figures, submitted to ACL ARR 2026, hyperlink to code repository provided in the abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03380 2026-01-27 cs.CL cs.AI 84%

Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning

面向推理导向强化学习的在线难度过滤

Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能研究所) TwelveLabs

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。

Comments To appear in EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06677 2026-01-13 cs.LG cs.AI 84%

Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget

可塑性与刚性:低秩适配器对微预算推理的影响

Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过低秩适配器在微预算下提升小型模型推理能力,发现高秩适配器能显著增强模型可塑性,但数学对齐模型性能下降,揭示了预算限制对模型优化的复杂影响。

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19361 2026-01-09 cs.CL cs.AI 84%

AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation

AgenticMath: 通过基于代理的数学数据生成增强LLM推理

Xianyang Liu, Yilin Liu, Shuai Wang, Hao Cheng, Andrew Estornell, Yuzhi Zhao, Jun Shu, Jiaheng Wei

机构 * King’s College London(伦敦国王学院) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 AgenticMath通过基于代理的数学数据生成方法,提升LLM在数学推理任务上的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10019 2025-12-16 cs.CL cs.AI 84%

Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning

通过问题空间映射解耦理解与推理以提升小型模型推理能力

Li Wang, Changhao Zhang, Zengqi Xiu, Kai Lu, Xin Yu, Kui Zhang, Wenjun Wu

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DURIT通过问题空间映射解耦理解和推理,提升小型模型在数学和逻辑推理任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03176 2025-12-04 cs.LG cs.AI 84%

Plantain: Plan-Answer Interleaved Reasoning

Plantain: 计划-答案交错推理

Anthony Liang, Jonathan Berant, Adam Fisch, Abhimanyu Goyal, Kalpesh Krishna, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Plantain通过计划-思考-回答的交错推理方式,提升数学推理和编码任务的性能,同时减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01657 2025-11-19 cs.LG cs.AI 84%

Improving Rule-based Reasoning in LLMs using Neurosymbolic Representations

Varun Dhanraj, Chris Eliasmith

机构 * School of Computer Science, University of Waterloo, Waterloo, Canada(计算机科学学院,滑铁卢大学,滑铁卢,加拿大) Centre for Theoretical Neuroscience, University of Waterloo(理论神经科学中心,滑铁卢大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 30577--30596

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22638 2025-11-06 cs.LG cs.AI 84%

Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training

Aadim Nepal, Safal Shrestha, Anubhav Shrestha, Minwu Kim, Jalal Naghiyev, Ravid Shwartz-Ziv, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Technical University of Munich(慕尼黑技术大学) NYU Center for Data Science(纽约大学数据科学中心)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24256 2025-11-03 cs.CL cs.LG 84%

From Memorization to Reasoning in the Spectrum of Loss Curvature

Jack Merullo, Srihita Vatsavaya, Lucius Bushnaq, Owen Lewis

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23629 2025-10-29 cs.LG cs.AI cs.PL 84%

Chain of Execution Supervision Promotes General Reasoning in Large Language Models

Nuo Chen, Zehua Li, Keqin Bao, Junyang Lin, Dayiheng Liu

机构 * Qwen Team, Alibaba(阿里巴巴通义实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20272 2025-10-24 cs.LG cs.AI 84%

Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs

Tristan Cinquin, Geoff Pleiss, Agustinus Kristiadi

机构 * University of Tübingen(图宾根大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Western University(西部大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23703 2025-10-14 cs.AI cs.CL 84%

Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability

Ruida Wang, Yuxin Li, Yi R. Fung, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01928 2025-10-07 cs.LG cs.AI 84%

MALT: Improving Reasoning with Multi-Agent LLM Training

Sumeet Ramesh Motwani, Chandler Smith, Rocktim Jyoti Das, Rafael Rafailov, Ivan Laptev, Philip H. S. Torr, Fabio Pizzati, Ronald Clark, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Cooperative AI Foundation(合作人工智能基金会) MBZUAI(穆扎夫卡尔人工智能研究所) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21998 2025-10-03 cs.AI cs.LG 84%

GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments

Hanlin Zhu, Tianyu Guo, Song Mei, Stuart Russell, Nikhil Ghosh, Alberto Bietti, Jiantao Jiao

机构 * UC Berkeley(加州大学伯克利分校) Flatiron Institute(Flatiron研究所) Nvidia(英伟达)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

Comments 39 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00194 2025-10-02 cs.LG cs.AI 84%

GRPO-$λ$: Credit Assignment improves LLM Reasoning

Prasanna Parthasarathi, Mathieu Reymond, Boxing Chen, Yufei Cui, Sarath Chandar

机构 * Noah’s Ark Lab, Huawei Technologies Ltd.(华为技术有限公司诺亚实验室) Chandar Research Lab(昌达研究实验室) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Polytechnique Montréal Canada(蒙特利尔理工学院加拿大) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18706 2025-10-02 cs.LG cs.AI 84%

Steering LLM Reasoning Through Bias-Only Adaptation

Viacheslav Sinii, Alexey Gorbatovski, Artem Cherepanov, Boris Shaposhnikov, Nikita Balagansky, Daniil Gavrilov

机构 * T-Tech Central University(中央大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23962 2025-09-30 cs.AI cs.CL 84%

Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models

Guanxu Chen, Yafu Li, Yuxian Jiang, Chen Qian, Qihan Ren, Jingyi Yang, Yu Cheng, Dongrui Liu, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04535 2025-09-23 cs.CL cs.AI 84%

Meta-Reasoning Improves Tool Use in Large Language Models

Lisa Alazraki, Marek Rei

机构 * Imperial College London(伦敦帝国学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07238 2025-09-10 cs.LG cs.AI 84%

Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning

Pranav Pawar, Dhwaj Jain, Varun Gupta, Kaustav Dedhia, Dashrath Kale, Sudhir Dhekane

机构 * Dwarkadas J. Sanghvi College of Engineering(达沃卡斯J·桑格维工程学院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05229 2025-08-28 cs.LG cs.AI 84%

GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models

Iman Mirzadeh, Keivan Alizadeh, Hooman Shahrokhi, Oncel Tuzel, Samy Bengio, Mehrdad Farajtabar

机构 * Apple(苹果公司) Washington State University(华盛顿州立大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

Comments ICLR camera ready + additional discussion in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15842 2025-08-25 cs.CL cs.LG 84%

Lexical Hints of Accuracy in LLM Reasoning Chains

Arne Vanhoyweghen, Brecht Verbeken, Andres Algaba, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 数学推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04823 2025-08-19 cs.CL cs.AI 84%

Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models

Ruikang Liu, Yuxuan Sun, Manyi Zhang, Haoli Bai, Xianzhi Yu, Tiezheng Yu, Chun Yuan, Lu Hou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏