arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44666 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3205 篇

2311.09724 2024-04-02 cs.AI cs.CL 88%

OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning

Fei Yu, Anningzhe Gao, Benyou Wang

专题命中 数学推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL findings. https://github.com/FreedomIntelligence/OVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09849 2024-03-18 cs.CL cs.AI 88%

Self-Consistency Boosts Calibration for Math Reasoning

Ante Wang, Linfeng Song, Ye Tian, Baolin Peng, Lifeng Jin, Haitao Mi, Jinsong Su, Dong Yu

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09662 2023-05-25 cs.CL cs.AI cs.CV 88%

MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering

Fangyu Liu, Francesco Piccinno, Syrine Krichene, Chenxi Pang, Kenton Lee, Mandar Joshi, Yasemin Altun, Nigel Collier, Julian Martin Eisenschlos

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11903 2023-01-12 cs.CL cs.AI 88%

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.06743 2021-10-20 cs.CL cs.AI 88%

Exploring Generalization Ability of Pretrained Language Models on Arithmetic and Logical Reasoning

Cunxiang Wang, Boyuan Zheng, Yuchen Niu, Yue Zhang

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NLPCC2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 88%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07720 2026-06-09 cs.AI cs.CL cs.LG 新提交 88%

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆

Mujtaba Farhan, Maheep Chaudhary

机构 * University of Cambridge(剑桥大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26414 2026-05-27 cs.AI cs.CL cs.LG 88%

Reasoning, Code, or Both? How Large Language Models Handle Variations in Math Questions

推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化

Matthew Kutakh

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过对比链式思维推理、单次代码执行和迭代代码执行三种方法在GSM-Symbolic数据集上的表现,发现代码执行并未提升大型语言模型在数学问题变体上的推理鲁棒性。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10799 2026-05-18 cs.LG cs.AI cs.CL 88%

The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies

最后的答案往往获胜:链式思维腐败研究中的格式混淆

Gabriel Garcia

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示链式思维腐败测试中,最终答案的位置影响准确性,而非中间计算步骤,提出新的研究协议以避免格式混淆。

Comments 34 pages, 6 figures, 13 tables. Submitted to NeurIPS 2026. Code and data: https://github.com/Gpgabriel25/LastWordWinsCoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03332 2026-04-20 cs.CL cs.AI cs.LG 88%

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

脆弱的思考:大型语言模型如何处理推理链扰动

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08808 2026-01-14 cs.CL cs.AI cs.LG 88%

Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge

多路思考:通过令牌级分支-合并进行推理

Yao Tang, Li Dong, Yaru Hao, Qingxiu Dong, Furu Wei, Jiatao Gu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 多路思考是一种通过令牌级分支-合并机制实现软推理的新方法,能自适应地在离散和连续之间切换,从而在数学推理任务中优于传统CoT和RL基线。

Comments 21 pages. Code available at https://github.com/GMLR-Penn/Multiplex-Thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04686 2025-10-07 cs.CL cs.AI cs.LG 88%

Unlocking Multimodal Mathematical Reasoning via Process Reward Model

Ruilin Luo, Zhuofan Zheng, Yifan Wang, Xinzhe Ni, Zicheng Lin, Songtao Jiang, Yiyao Yu, Chufan Shi, Lei Wang, Ruihang Chu, Jin Zeng, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Zhejiang University(浙江大学) Ping An Technology (Shenzhen) Co., Ltd(平安科技(深圳)有限公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

Comments NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10026 2025-08-15 cs.CL cs.AI cs.LG 88%

SABER: Switchable and Balanced Training for Efficient LLM Reasoning

Kai Zhao, Yanjun Zhao, Jiaming Song, Shien He, Lusheng Zhang, Qiang Zhang, Tianjiao Li

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14308 2023-06-27 cs.CL cs.AI 88%

Let's Do a Thought Experiment: Using Counterfactuals to Improve Moral Reasoning

Xiao Ma, Swaroop Mishra, Ahmad Beirami, Alex Beutel, Jilin Chen

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

Comments 8 pages, ICML Neural Conversational AI workshop, thought experiments, moral reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11634 2026-06-11 cs.AI 新提交 88%

Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力

Kai Liu, Peijie Dong, Xinchen Xie, Jianfei Gao, Qipeng Guo, Xiaowen Chu, Shaoting Zhang, Kai Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Shanghai AI Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

AI总结 提出SWARR方法,通过监督微调将预训练自注意力模型高效转换为滑动窗口注意力,并利用强化学习策略适应,缩小了与自注意力的性能差距,同时保持线性复杂度的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22597 2026-04-27 cs.AI 88%

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

机构 * Tel-Aviv University(特拉维夫大学) Amazon Prime Video(亚马逊Prime视频) Ben-Gurion University(巴内尔·戈里翁大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04023 2026-04-24 cs.CL 88%

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08369 2026-03-10 cs.AI 88%

M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering

M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知

Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL 88%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16309 2025-12-15 cs.AI 88%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier

MedRule-KG:一种由知识图谱引导的轻量级验证器支持的数学推理框架

Crystal Su

专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI

AI总结 MedRule-KG通过结合知识图谱和轻量级验证器,提升数学推理的准确性和规则一致性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11704 2025-11-18 cs.LG cs.CV 88%

Simple Vision-Language Math Reasoning via Rendered Text

Matvey Skripkin, Elizaveta Goncharova, Andrey Kuznetsov

机构 * FusionBrain Lab(融合脑实验室) HSE University(俄罗斯高等经济学院) Innopolis University(因诺波利斯大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00808 2025-11-04 cs.AI 88%

Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?

Bowen Fang, Ruijian Zha, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Engineering Mechanics, Columbia University(哥伦比亚大学工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Data Science Institute, Columbia University(哥伦比亚大学数据科学研究院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14958 2025-10-17 cs.CV cs.CL 88%

MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

Weikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang, Aojun Zhou, Changyao Tian, Xinyu Fu, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu, Rui Liu, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(中文大学多媒体实验室) Huawei Research(华为研究) BUAA(北京航空学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

Comments Project Page: https://mathcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14387 2025-10-17 cs.AI 88%

Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?

Yijie Hu, Zihao Zhou, Kaizhu Huang, Xiaowei Huang, Qiufeng Wang

机构 * Xi’an-Jiaotong Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Duke Kunshan University(杜克昆山大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16326 2025-06-12 cs.CL 88%

Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic

Xin Zheng, Jie Lou, Boxi Cao, Xueru Wen, Yuqiu Ji, Hongyu Lin, Yaojie Lu, Xianpei Han, Debing Zhang, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc(小红书公司)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL

Comments Accepted at ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12226 2025-01-22 cs.LG 88%

CDW-CoT: Clustered Distance-Weighted Chain-of-Thoughts Reasoning

Yuanheng Fang, Guoqing Chao, Wenqiang Lei, Shaobo Li, Dianhui Chu

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.LG

Comments aaai25(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04197 2024-09-24 cs.CL 88%

DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning

Shangqing Tu, Kejian Zhu, Yushi Bai, Zijun Yao, Lei Hou, Juanzi Li

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12148 2024-08-23 cs.AI 88%

Multi-tool Integration Application for Math Reasoning Using Large Language Model

Zhihua Duan, Jialin Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09805 2024-08-12 cs.CL 88%

DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents

Yilun Zhao, Yitao Long, Hongjun Liu, Ryo Kamoi, Linyong Nan, Lyuhao Chen, Yixin Liu, Xiangru Tang, Rui Zhang, Arman Cohan

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);chain-of-thought(abstract);分类 cs.CL

Comments ACL 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18248 2024-07-26 cs.CL 88%

Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning

Tianduo Wang, Shichen Li, Wei Lu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

Comments ACL 2024. Code and data are available at https://github.com/TianduoWang/DPO-ST

详情

展开后加载摘要…

URL PDF HTML 收藏