arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44666 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3205 篇

2501.04519 2025-01-09 cs.CL 89%

rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking

Xinyu Guan, Li Lyna Zhang, Yifei Liu, Ning Shang, Youran Sun, Yi Zhu, Fan Yang, Mao Yang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16812 2024-10-23 cs.CL 89%

Optimizing Chain-of-Thought Reasoning: Tackling Arranging Bottleneck via Plan Augmentation

Yuli Qiu, Jiashu Yao, Heyan Huang, Yuhang Guo

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12288 2024-09-04 cs.AI 89%

An Investigation of Neuron Activation as a Unified Lens to Explain Chain-of-Thought Eliciting Arithmetic Reasoning of LLMs

Daking Rai, Ziyu Yao

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

Comments 9 pages, 1 figure, to be published in ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13888 2024-03-21 cs.CL 89%

PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning

Xuekai Zhu, Biqing Qi, Kaiyan Zhang, Xinwei Long, Zhouhan Lin, Bowen Zhou

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

Comments NAACL 2024 Long Paper; Code and data are available at https://github.com/Xuekai-Zhu/pad

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14323 2023-11-07 cs.CL 89%

ChatCoT: Tool-Augmented Chain-of-Thought Reasoning on Chat-based Large Language Models

Zhipeng Chen, Kun Zhou, Beichen Zhang, Zheng Gong, Wayne Xin Zhao, Ji-Rong Wen

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

Comments 14 pages, working in progress, Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11499 2023-10-03 cs.CL 89%

RCOT: Detecting and Rectifying Factual Inconsistency in Reasoning by Reversing Chain-of-Thought

Tianci Xue, Ziqi Wang, Zhenhailong Wang, Chi Han, Pengfei Yu, Heng Ji

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

Comments 24 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13911 2023-07-03 cs.AI 89%

Federated Prompting and Chain-of-Thought Reasoning for Improving LLMs Answering

Xiangyang Liu, Tianqi Pang, Chenyou Fan

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03862 2026-06-09 cs.AI cs.CL 版本更新 89%

Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

正确性不足:通过执行器导向的奖励训练推理计划器

Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang, Junhao Su

机构 * D 4 Lab(D4实验室) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,summary_cn);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLift框架,通过执行器导向的奖励提升推理质量,利用rubric-based Reasoning Reward Model评估推理轨迹的可靠性与有效性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22437 2026-05-29 cs.AI cs.CL 89%

Modeling Hierarchical Thinking in Large Reasoning Models

大型推理模型中的层次化思维建模

G M Shahariar, Erfan Shayegani, Ali Nazari, Nael Abu-Ghazaleh

机构 * University of California, Riverside(加州大学河滨分校) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出将大型推理模型(LRM)的层次化推理动态近似为有限状态机(FSM)中的轨迹,并通过Q值引导的推理时控制方法实现高效推理优化。

Comments Accepted in ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09806 2026-05-12 cs.LG cs.AI 89%

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

LEAD:高效适应性与动态推理用于大语言模型

Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Emory University(埃默里大学) Individual Researcher(独立研究员) University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Florida(佛罗里达大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 LEAD通过动态校准正确性与效率的权衡,提升大语言模型的推理效率与准确性,实现更短的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 89%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22925 2026-07-28 cs.CL cs.AI cs.LG 新提交 89%

Not All LLM Reasoning is Visible in the Chain-of-Thought

并非所有大语言模型的推理都能在思维链中体现

Vatsal Baherwani, Tom Goldstein, Ashwinee Panda

机构 * New York University(纽约大学) University of Maryland(马里兰大学) TogetherAI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06660 2026-05-08 cs.LG cs.AI cs.CL 89%

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

基于验证器的数学推理硬问题生成

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Statistics, University of Oxford(牛津大学统计系)

专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14828 2026-03-24 cs.CL cs.AI cs.LG 89%

Long Chain-of-Thought Reasoning Across Languages

跨语言的长链式推理

Josh Barua, Seun Eisape, Kayo Yin, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了跨语言长链式推理能力的扩展机制,发现模型规模扩展提升En-CoT性能,但Target-CoT表现滞后,尤其在数学推理中更为明显。通过预训练和后训练优化,多语言模型在推理效率和稳定性上取得进展,同时揭示了语言特定的失败模式。

Comments Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16514 2025-08-25 cs.LG cs.AI cs.CL 89%

FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline

Parker Seegmiller, Kartik Mehta, Soumya Saha, Chenyang Tao, Shereen Oraby, Arpit Gupta, Tagyoung Chung, Mohit Bansal, Nanyun Peng

机构 * Amazon AGI Foundations(亚马逊人工智能基础研究机构) Dartmouth College(达特茅斯学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18973 2025-08-25 cs.CL cs.AI cs.LG 89%

A Toolbox, Not a Hammer -- Multi-TAG: Scaling Math Reasoning with Multi-Tool Aggregation

Bohan Yao, Vikas Yadav

机构 * ServiceNow AI University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at EMNLP Findings 2025; 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07424 2025-07-11 cs.CV 89%

Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning

Jingjing Jiang, Chao Ma, Xurui Song, Hanwang Zhang, Jun Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15084 2025-01-20 cs.CL cs.AI cs.LG 89%

AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling

Zihan Liu, Yang Chen, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05506 2024-07-18 cs.CL cs.AI cs.LG 89%

MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning

Chengpeng Li, Zheng Yuan, Hongyi Yuan, Guanting Dong, Keming Lu, Jiancan Wu, Chuanqi Tan, Xiang Wang, Chang Zhou

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00799 2024-03-05 cs.CL cs.AI cs.LG 89%

An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning

Zui Chen, Yezeng Chen, Jiaqi Han, Zhijie Huang, Ji Qi, Yi Zhou

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05282 2026-07-22 cs.CL 89%

Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning

并非所有错误都是同等重要:ASCoT解决高效大语言模型推理中的晚期脆弱性

Dongxu Zhang, Yujun Wu, Yiding Sun, Jinnan Yang, Ning Yang, Jihua Zhu, Miao Xin, Baoliang Tian

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, CASIA(中国科学院自动化研究所) Bytedance(字节跳动)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);self-correction(abstract)

AI总结 ASCoT通过自适应校正机制提升大语言模型推理效率与可靠性,减少计算资源消耗的同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15877 2026-06-16 cs.CL cs.AI 新提交 88%

Free Energy Heuristics: Fast-And-Frugal Cognition as Active Inference Under Uncertain Precision

自由能启发式:作为不确定精度下主动推理的快速节俭认知

Alex Bogdan

机构 * Evolutionairy AI Toronto, Canada(进化人工智能(多伦多,加拿大))

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出元不确定性决定链式思维(CoT)的效果:当模型对自身证据的可靠性高度不确定时,更多推理会降低准确率。通过自由能最小化策略证明,在重尾精度先验下,有限数量的高有效性线索后停止整合,与“取最优”启发式等价。实验验证了高元不确定性下长CoT导致准确率下降17.3个百分点。

Comments 64 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13941 2026-03-17 cs.LG cs.AI 88%

Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning

Nemotron-CrossThink: 在数学推理之外实现自学习的扩展

Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NEMOTRON-CROSSTHINK框架,通过整合多领域数据提升推理泛化能力,改进数学和非数学任务的准确性与效率。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07154 2025-11-26 cs.LG cs.AI 88%

Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning

重新思考扩展测试时间计算时的微调:限制置信度可提升数学推理

Feng Chen, Allan Raventos, Nan Cheng, Surya Ganguli, Shaul Druckmann

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 通过限制模型置信度改进数学推理,研究发现传统交叉熵损失与测试时间策略pass@N存在不一致,提出改进的训练损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03238 2025-10-03 cs.CL cs.AI 88%

FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4

Jiarui Yao, Ruida Wang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25941 2025-10-01 cs.AI cs.CL 88%

Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA

Raphael Schumann, Stefan Riezler

机构 * Heidelberg University(海德堡大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21560 2025-07-29 cs.CL cs.AI 88%

Reinforcement learning fine-tuning of language model for instruction following and math reasoning

Yifu Han, Geo Zhang

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16930 2025-06-19 cs.CL cs.AI 88%

Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes

Bryan R. Christ, Zack Gottesman, Jonathan Kropko, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 38 pages, 54 figures, Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21659 2025-05-22 cs.AI cs.CL 88%

Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization

Haotian Luo, Haiying He, Yibo Wang, Jinluan Yang, Rui Liu, Naiqiang Tan, Xiaochun Cao, Dacheng Tao, Li Shen

机构 * Sun Yat-sen University(中山大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Didichuxing Co. Ltd(滴滴出行公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10735 2025-02-11 cs.AI cs.CL 88%

Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning

Kuofeng Gao, Huanqia Cai, Qingyao Shuai, Dihong Gong, Zhifeng Li

专题命中 数学推理 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏