arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2211.09066 2022-11-17 cs.LG cs.AI cs.CL 82%

Teaching Algorithmic Reasoning via In-context Learning

Hattie Zhou, Azade Nova, Hugo Larochelle, Aaron Courville, Behnam Neyshabur, Hanie Sedghi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05660 2022-04-13 cs.CL cs.AI cs.LG 82%

NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks

Swaroop Mishra, Arindam Mitra, Neeraj Varshney, Bhavdeep Sachdeva, Peter Clark, Chitta Baral, Ashwin Kalyan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03921 2021-06-09 cs.CL cs.AI cs.LG 82%

Measuring and Improving BERT's Mathematical Abilities by Predicting the Order of Reasoning

Piotr Piękos, Henryk Michalewski, Mateusz Malinowski

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The paper has been accepted to the ACL-IJCNLP 2021 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 82%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL 82%

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13706 2025-12-17 cs.LG cs.CL 82%

Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training

通过混合训练缓解数学推理微调中的灾难性遗忘

John Graham Reynolds

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。

Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06522 2025-11-11 cs.AI cs.LG 82%

FractalBench: Diagnosing Visual-Mathematical Reasoning Through Recursive Program Synthesis

Jan Ondras, Marek Šuppa

机构 * MIT(麻省理工学院) Comenius University in Bratislava(布拉迪斯拉发孔院大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to The 5th Workshop on Mathematical Reasoning and AI at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025); 25 pages, 14 figures, 8 tables; Code available at https://github.com/NaiveNeuron/FractalBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03808 2025-11-07 cs.LG cs.AI 82%

Optimizing Reasoning Efficiency through Prompt Difficulty Prediction

Bo Zhao, Berkcan Kapusuzoglu, Kartik Balasubramaniam, Sambit Sahu, Supriyo Chakraborty, Genta Indra Winata

机构 * UC San Diego(加州大学圣地亚哥分校) Capital One(Capital One公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17496 2025-11-03 cs.LG cs.AI 82%

I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models

Giacomo Camposampiero, Michael Hersche, Roger Wattenhofer, Abu Sebastian, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at the 5th Workshop on Mathematical Reasoning and AI (MATH-AI), NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00726 2025-08-29 cs.AI cs.LG 82%

Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess

Dongyoon Hwang, Hojoon Lee, Jaegul Choo, Dongmin Park, Jongho Park

机构 * KAIST AI(韩国科学技术院人工智能研究所) KRAFTON(KRAFTON公司) UC Berkeley(伯克利大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08989 2025-06-11 cs.LG cs.CL 82%

SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning

Xiao Liang, Zhong-Zhi Li, Yeyun Gong, Yang Wang, Hengyuan Zhang, Yelong Shen, Ying Nian Wu, Weizhu Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) School of Artificial Intelligence Chinese Academy of Sciences(中国科学院人工智能学院) Microsoft(微软) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Reinforcement Learning; Large Language Models; LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01207 2026-08-06 cs.CV cs.AI 版本更新 81%

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择

Puzhuo Zheng, Hasan Kurban

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02003 2026-06-30 cs.CL cs.HC 81%

HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

HoT: 用于从输入中引用支持事实的高亮推理链

Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(亚伯拉罕大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19302 2026-05-28 cs.CL 81%

Formula-One Prompting: A Composable Equation-First Prefix for Applied Mathematics

Formula-One Prompting:一种可组合的方程优先前缀用于应用数学

Natapong Nitarach, Pittawat Taveekitworachai, Kunat Pipatanakul

机构 * SCB DataX, SCBX Group(SCB数据X,SCBX集团)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出公式提示(FP)和Formula-One提示(F-1),通过先形式化问题中的控制方程再求解,在多个应用数学基准上优于思维链和程序思维提示,平均提升5.76和8.42个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10443 2026-05-08 cs.SE cs.AI 81%

Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?

大型语言模型在语义保持变异下的理解鲁棒性如何?

Pedro Orvalho, Marta Kwiatkowska

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)

专题命中 数学推理 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。

Comments 17 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12736 2026-04-15 cs.CL 81%

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来

Xingyu Lin, Yilin Wen, Du Su, Jinchang Hou, En Wang, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08665 2025-08-14 cs.AI 81%

Aryabhata: An exam-focused language model for JEE Math

Ritvik Rastogi, Sachin Dharashivkar, Sandeep Varma

机构 * PhysicsWallah(物理墙)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01714 2024-03-12 cs.LG 81%

Large Language Models as Analogical Reasoners

Michihiro Yasunaga, Xinyun Chen, Yujia Li, Panupong Pasupat, Jure Leskovec, Percy Liang, Ed H. Chi, Denny Zhou

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14277 2026-08-17 cs.CL cs.AI 新提交 81%

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏

Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01014 2026-08-17 cs.CL cs.AI 版本更新 81%

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何

Yuzhou Liu, Xiyang Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。

Comments 14 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 81%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23333 2026-08-11 cs.LG cs.CL 版本更新 81%

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

校准大语言模型推理的置信度边际过程监督

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 81%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06465 2026-08-11 cs.CL cs.AI 版本更新 81%

Multi-objective Evolutionary Merging Enables Efficient Reasoning Models

多目标进化融合实现高效推理模型

Mario Iacobelli, Adrian Robert Minut, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli, Iacopo Masi, Emanuele Rodolà

机构 * Sapienza University of Rome(罗马大学) Independent Researcher(独立研究员) EPFL(瑞士联邦理工学院洛桑) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18587 2026-08-11 cs.LG cs.AI stat.ML 版本更新 81%

An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning

面向大语言模型推理的强化学习的期望最大化视角

Tianbing Xu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出EM策略梯度(EMPG)框架,将大语言模型推理的强化学习转化为期望最大化问题,在简化优化流程的同时,在GSM8K、MATH Hard数据集上取得与GRPO相当或更优的性能,且能生成更简洁的结构化推理轨迹。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05168 2026-08-07 cs.AI cs.CL 新提交 81%

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

啄木鸟蒸馏:弱模型诊断强模型中的推理错误

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01997 2026-08-07 cs.LG cs.AI 版本更新 81%

On the Limits of Layer Pruning for Generative Reasoning in Large Language Models

关于生成推理中大语言模型层剪枝的极限

Safal Shrestha, Anubhav Shrestha, Aadim Nepal, Minwu Kim, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交 81%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 81%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26119 2026-07-30 cs.AI cs.CL 新提交 81%

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量

Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。

Comments Second Workshop on XAI4Science, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏