arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2605.25977 2026-05-26 cs.CL cs.AI cs.LG 87%

Creative Quality Alignment: Expert Tacit Knowledge Transfer via Chain-of-Thought Fine-Tuning

创意质量对齐:通过思维链微调实现专家隐性知识迁移

Bo Zou, Chao Xu

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07139 2026-05-11 cs.CL cs.AI cs.LG 87%

Structural Rationale Distillation via Reasoning Space Compression

通过推理空间压缩实现结构性理性提炼

Jialin Yang, Jiankun Wang, Jiajun Wu, Henry Leung, Jiayu Zhou, Steve Drew

机构 * University of Calgary(卡尔加里大学) University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出D-RPC方法,通过压缩推理空间约束教师模型生成一致且多样化的推理路径,提升学生模型在数学和常识推理任务中的表现,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04237 2026-04-22 cs.AI cs.CL cs.LG 87%

SAGE-32B: Agentic Reasoning via Iterative Distillation

SAGE-32B:通过迭代蒸馏实现代理推理

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(韦达学院) Madan Bhandari Memorial College(马丹·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。

Comments 23 Pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG 87%

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20745 2026-03-03 cs.AI cs.CL cs.LG 87%

AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent

AgentMath: 通过工具增强代理赋能大语言模型的数学推理

Haipeng Luo, Huawen Feng, Qingfeng Sun, Can Xu, Kai Zheng, Yufei Wang, Tao Yang, Han Hu, Yansong Tang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AgentMath通过整合语言模型和代码解释器,提升大语言模型在复杂数学问题上的推理能力,实现高效训练和高准确率。

Comments This paper has been accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04925 2026-02-06 cs.LG cs.AI cs.CL 87%

Internalizing LLM Reasoning via Discovery and Replay of Latent Actions

将LLM推理内化:通过发现和重播潜在动作

Zhenning Shi, Yijia Zhu, Junhan Shi, Xun Zhang, Lei Wang, Congcong Miao

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Fuzhou University(福州大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10336 2026-01-16 cs.AI cs.CL cs.LG cs.SC 87%

CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical Reasoning

CoMAT:数学注释的思维链提升数学推理

Joshua Ong Jun Leang, Aryo Pradipta Gema, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) Imperial College London(伦敦帝国学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoMAT通过符号转换和推理执行两个阶段提升数学推理能力,在多个基准测试中超越传统CoT方法。

Comments 9 pages, 12 figures

Journal ref Proc. EMNLP 2025, pp. 20245-20274

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14641 2026-01-09 cs.CL cs.AI cs.LG 87%

Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shot

重新审视链式思维提示:零样本可以比少样本更强

Xiang Cheng, Chengyan Pan, Minjun Zhao, Deyang Li, Fangchao Liu, Xinyu Zhang, Xiao Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香河人工智能学院) Huawei Poisson Lab(华为Poisson实验室)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现,对于强模型而言,传统CoT示例对推理性能无帮助,且模型更关注指令而非示例,揭示了ICL+CoT框架在数学推理中的局限性。

Comments EMNLP25-findings camera_ready, 19 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05105 2025-12-05 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 87%

Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning

语义软引导:无需强化学习的LLM长上下文推理

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07124 2025-11-11 cs.CL cs.AI cs.LG 87%

Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought

Zhikang Chen, Sen Cui, Deheng Ye, Yu Zhang, Yatao Bian, Tingting Zhu

机构 * University of Oxford(牛津大学) Tsinghua University(清华大学) Tencent(腾讯) Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05179 2025-10-27 cs.CL cs.AI cs.LG 87%

Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketching

Simon A. Aytes, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03275 2025-09-03 cs.CL cs.AI cs.LG cs.LO 87%

Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning

DiJia Su, Hanlin Zhu, Yingchen Xu, Jiantao Jiao, Yuandong Tian, Qinqing Zheng

机构 * Meta AI

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11984 2025-07-11 cs.CL cs.AI cs.LG 87%

Understanding Chain-of-Thought in LLMs through Information Theory

Jean-Francois Ton, Muhammad Faaiz Taufiq, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10716 2025-06-13 cs.CL cs.AI cs.LG 87%

PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models

Ye Yu, Yaoning Yu, Haohan Wang

机构 * University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09820 2025-06-13 cs.CL cs.AI cs.LG 87%

CoRT: Code-integrated Reasoning within Thinking

Chengpeng Li, Zhengyang Tang, Ziniu Li, Mingfeng Xue, Keqin Bao, Tian Ding, Ruoyu Sun, Benyou Wang, Xiang Wang, Junyang Lin, Dayiheng Liu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14395 2025-03-06 cs.CL cs.AI cs.LG 87%

PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?

Mitodru Niyogi, Arnab Bhattacharya

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17416 2025-02-25 cs.CL cs.AI cs.LG 87%

Reasoning with Latent Thoughts: On the Power of Looped Transformers

Nikunj Saunshi, Nishanth Dikkala, Zhiyuan Li, Sanjiv Kumar, Sashank J. Reddi

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03226 2025-02-18 cs.CL cs.AI cs.LG 87%

BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning

Beichen Zhang, Yuhong Liu, Xiaoyi Dong, Yuhang Zang, Pan Zhang, Haodong Duan, Yuhang Cao, Dahua Lin, Jiaqi Wang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Codes and Data are available at https://github.com/beichenzbc/BoostStep

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06822 2024-12-11 cs.CL cs.AI cs.LG 87%

Guidance is All You Need: Temperature-Guided Reasoning in Large Language Models

Eyad Gomaa, Gomaa Salah

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00802 2024-08-05 cs.IR cs.AI cs.CL cs.LG 87%

Leveraging LLM Reasoning Enhances Personalized Recommender Systems

Alicia Y. Tsai, Adam Kraft, Long Jin, Chenwei Cai, Anahita Hosseini, Taibai Xu, Zemin Zhang, Lichan Hong, Ed H. Chi, Xinyang Yi

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17786 2024-02-29 cs.AI cs.CL cs.LG 87%

Stepwise Self-Consistent Mathematical Reasoning with Large Language Models

Zilong Zhao, Yao Rong, Dongyang Guo, Emek Gözlüklü, Emir Gülboy, Enkelejda Kasneci

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11054 2023-10-03 cs.CL cs.AI cs.LG cs.PL 87%

Design of Chain-of-Thought in Math Problem Solving

Zhanming Jie, Trung Quoc Luong, Xinbo Zhang, Xiaoran Jin, Hang Li

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14610 2023-03-03 cs.LG cs.AI cs.CL cs.CV 87%

Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning

Pan Lu, Liang Qiu, Kai-Wei Chang, Ying Nian Wu, Song-Chun Zhu, Tanmay Rajpurohit, Peter Clark, Ashwin Kalyan

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2023. 26 pages and 18 figures. The data and code are available at https://promptpg.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13850 2025-10-21 cs.CL cs.AI 87%

Revisiting the UID Hypothesis in LLM Reasoning Traces

Minju Gwak, Guijin Son, Jaehyung Kim

机构 * Department of Artificial Intelligence(人工智能系) Yonsei University(延世大学) OneLine AI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Journal ref The 5th Workshop on Mathematical Reasoning and AI, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07551 2024-05-14 cs.CL cs.AI 87%

MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning

Shuo Yin, Weihao You, Zhilong Ji, Guoqiang Zhong, Jinfeng Bai

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments The state-of-the-art open-source tool-use LLMs for mathematical reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15388 2026-07-20 cs.AI 新提交 86%

Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning

精确但未耦合:评审者的精确性并不能保证在多智能体数学推理中采纳批评意见

Chih-Hsuan Yang, Jingyan Jiang, Vikram Vasudevan, Cheng-Hau Yang, Huihuo Zheng, Le Chen, Eliu A. Huerta, Venkatram Vishwanath, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(title);math reasoning(title);verifier(abstract);分类 cs.AI

AI总结 研究多智能体数学推理中评审者精确性与采纳批评意见的关系,通过对4181个问题测试发现,仅评审者精确性无法解释结果,广播式讨论有时效果更好,还探究了不同干预对结果的影响,指出以评审者为中心的评估可能高估系统质量。

Comments 48 pages, 20 figures, 25 tables. Public release website: https://huggingface.co/spaces/AgentsSci/scientific-agent-protocol-traces-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-06-30 cs.CL 86%

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25926 2026-04-30 cs.CL cs.IR 86%

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

MATH-PT:一个针对欧洲葡萄牙语和巴西葡萄牙语的数学推理基准数据集

Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Fundação Getulio Vargas(古特曼基金会) Instituto de Telecomunicações(电信研究所) Universidade de Coimbra, CISUC/LASI, DEI(科英布拉大学,CISUC/LASI,DEI) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出MATH-PT数据集,包含1729个欧洲和巴西葡萄牙语数学问题,评估了当前最先进的LLM在数学推理中的表现,发现前沿模型在选择题表现优异,但在涉及图表或开放性问题时性能下降。

Comments Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08281 2026-04-20 cs.CL 86%

When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning

何时信任工具?用于工具集成数学推理的自适应工具信任校准

Ruotao Xu, Yixin Ji, Yu Luo, Jinpeng Li, Dong Li, Peifeng Li, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门) Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(HITSZ))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出ATTC框架,通过自适应选择信任或忽略工具结果来解决工具忽略问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14121 2026-04-16 cs.CL 86%

Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis

正确预测,错误步骤?基于共识推理的知识图谱用于鲁棒的推理链合成

Zipeng Ling, Shuliang Liu, Shenghong Fu, Yuehao Tang, Seonil Son, Yao Wan, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong Polytechnic University(香港理工大学) RLWRLD

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

AI总结 本文提出CRAFT框架,通过构建共识推理知识图谱缓解LLM推理中的内部和步骤性错误,提升推理链质量,实验显示其在逻辑和数学推理基准上表现优越。

详情

展开后加载摘要…

URL PDF HTML 收藏