arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2410.18890 2024-10-25 cs.AI 83%

Improving Small-Scale Large Language Models Function Calling for Reasoning Tasks

Graziano A. Manduzio, Federico A. Galatolo, Mario G. C. A. Cimino, Enzo Pasquale Scilingo, Lorenzo Cominelli

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14024 2024-10-21 cs.CL 83%

LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback

Bofei Gao, Zefan Cai, Runxin Xu, Peiyi Wang, Ce Zheng, Runji Lin, Keming Lu, Dayiheng Liu, Chang Zhou, Wen Xiao, Junjie Hu, Tianyu Liu, Baobao Chang

专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12934 2024-10-18 cs.CL 83%

Enhancing Mathematical Reasoning in LLMs by Stepwise Correction

Zhenyu Wu, Qingkai Zeng, Zhihan Zhang, Zhaoxuan Tan, Chao Shen, Meng Jiang

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10346 2024-10-04 cs.CL 83%

Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards

Hyeonbin Hwang, Doyoung Kim, Seungone Kim, Seonghyeon Ye, Minjoon Seo

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments EMNLP Findings 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19790 2024-10-01 cs.AI cs.CE 83%

Analysis on Riemann Hypothesis with Cross Entropy Optimization and Reasoning

Kevin Li, Fulu Li

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00459 2024-09-27 cs.CL 83%

NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning

Eli Schwartz, Leshem Choshen, Joseph Shtok, Sivan Doveh, Leonid Karlinsky, Assaf Arbelle

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00782 2024-07-16 cs.CL 83%

Step-Controlled DPO: Leveraging Stepwise Error for Enhanced Mathematical Reasoning

Zimu Lu, Aojun Zhou, Ke Wang, Houxing Ren, Weikang Shi, Junting Pan, Mingjie Zhan, Hongsheng Li

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07817 2024-07-02 cs.CL 83%

Question Translation Training for Better Multilingual Reasoning

Wenhao Zhu, Shujian Huang, Fei Yuan, Shuaijie She, Jiajun Chen, Alexandra Birch

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted to Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09072 2024-06-14 cs.CL 83%

Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?

Zhaochen Su, Juntao Li, Jun Zhang, Tong Zhu, Xiaoye Qu, Pan Zhou, Yan Bowen, Yu Cheng, Min zhang

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments This paper has been accepted to the ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01620 2024-06-11 cs.CL 83%

MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language Models

Justin Chih-Yao Chen, Swarnadeep Saha, Elias Stengel-Eskin, Mohit Bansal

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

Comments ICML 2024 (Camera-ready); First two authors contributed equally; GitHub: https://github.com/dinobby/MAGDi

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10695 2024-06-04 cs.CL 83%

LangBridge: Multilingual Reasoning Without Multilingual Supervision

Dongkeun Yoon, Joel Jang, Sungdong Kim, Seungone Kim, Sheikh Shafayat, Minjoon Seo

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14565 2024-05-02 cs.CL 83%

A Chain-of-Thought Prompting Approach with LLMs for Evaluating Students' Formative Assessment Responses in Science

Clayton Cohn, Nicole Hutchins, Tuan Le, Gautam Biswas

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

Comments In press at EAAI-24: The 14th Symposium on Educational Advances in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17231 2024-04-04 cs.CL 83%

MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning

Debrup Das, Debopriyo Banerjee, Somak Aditya, Ashish Kulkarni

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03799 2024-03-29 cs.CL 83%

Prompt Space Optimizing Few-shot Reasoning Success with Large Language Models

Fobo Shi, Peijun Qing, Dong Yang, Nan Wang, Youbo Lei, Haonan Lu, Xiaodong Lin, Duantengchuan Li

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Natural language processing (NLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17226 2024-02-28 cs.CL 83%

Reasoning in Conversation: Solving Subjective Tasks through Dialogue Simulation for Large Language Models

Xiaolong Wang, Yile Wang, Yuanchi Zhang, Fuwen Luo, Peng Li, Maosong Sun, Yang Liu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16257 2024-01-01 cs.CL 83%

Solving Math Word Problems via Cooperative Reasoning induced Language Models

Xinyu Zhu, Junjie Wang, Lin Zhang, Yuxiang Zhang, Ruyi Gan, Jiaxing Zhang, Yujiu Yang

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

Comments Accepted to ACL 2023 Main Conference; Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14747 2023-12-21 cs.CL 83%

MCC-KD: Multi-CoT Consistent Knowledge Distillation

Hongzhan Chen, Siyue Wu, Xiaojun Quan, Rui Wang, Ming Yan, Ji Zhang

专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);分类 cs.CL

Comments Accepted to ENMLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04813 2023-10-19 cs.CL 83%

Explanation Selection Using Unlabeled Data for Chain-of-Thought Prompting

Xi Ye, Greg Durrett

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10080 2023-10-17 cs.CL 83%

Let's reward step by step: Step-Level reward model as the Navigators for Reasoning

Qianli Ma, Haotian Zhou, Tingkai Liu, Jianbo Yuan, Pengfei Liu, Yang You, Hongxia Yang

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24760 2025-10-21 cs.LG cs.AI cs.CL 83%

REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards

Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones, Abdulhakeem Adefioye, Jean Kaddour, Andreas Köpf

机构 * Open-Thought Scale AI University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 Spotlight. For code, see https://github.com/open-thought/reasoning-gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03731 2023-10-06 cs.CL cs.AI cs.CV cs.LG 83%

MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning

Ke Wang, Houxing Ren, Aojun Zhou, Zimu Lu, Sichun Luo, Weikang Shi, Renrui Zhang, Linqi Song, Mingjie Zhan, Hongsheng Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The state-of-the-art open-source language models for mathematical reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 82%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG;math reasoning(comments)

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18612 2026-04-22 cs.NE cs.AI cs.LG 82%

Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models

Agent-GWO: 为大型语言模型的动态提示优化设计的协作代理

Xudong Wang, Chaoning Zhang, Chenghao Li, Shuxu Chen, Qigan Sun, Jiaquan Zhang, Fachrina Dewi Puspitasari, Tae-Ho Kim, Jiwei Wei, Malu Zhang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Kyung Hee University(韩国庆熙大学) University of Electronic Science and Technology of China(电子科技大学) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent-GWO框架,通过统一提示模板和解码超参数作为可继承的代理配置,利用灰狼优化器的领导者-追随者机制,自动选择领导者代理以指导协作更新,提升复杂推理的准确性和稳定性。

Comments Accepted to ACL 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23225 2026-03-02 cs.CL cs.AI 82%

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

为何扩散语言模型在真正并行(非自回归)解码中表现不佳?

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) ELLIS Institute Tübingen, Tübingen, Germany(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心) University of Surrey, Guildford, United Kingdom(萨里大学) The University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 本文提出NAP方法,通过数据驱动策略改进扩散语言模型的非自回归并行解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13173 2025-02-20 cs.LG cs.AI 82%

Thinking Preference Optimization

Wang Yang, Hongye Jin, Jingfeng Yang, Vipin Chaudhary, Xiaotian Han

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13122 2025-01-24 cs.CL cs.AI 82%

Zero-Shot Verification-guided Chain of Thoughts

Jishnu Ray Chowdhury, Cornelia Caragea

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00671 2026-08-13 cs.AI cs.CL cs.LG 版本更新 82%

Moxia: A Trust-First Neuro-Symbolic Execution Architecture for Self-Explaining Mathematical Reasoning

AXIOM: 一种用于可验证数学推理的信任优先神经符号执行架构

Alessio Bruno

机构 * Independent researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXIOM架构,将语言模型限制为规范化器,通过确定性计算机代数系统管道实现可验证的数学推理,在4个MATH类别上达到94.36%的正确率和100%的信任度。

Comments Preprint. 16 pages, 2 figures. Live interactive demo: https://huggingface.co/spaces/Squagghy/moxia. Paper artifact and dataset on Zenodo (concept-DOI): 10.5281/zenodo.21906509

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16097 2026-08-11 cs.LG cs.AI cs.CL 版本更新 82%

Understanding Reasoning from Pretraining to Post-Training

理解从预训练到训练后阶段的推理

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(模态实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27201 2026-08-11 cs.CL cs.AI cs.LG 版本更新 82%

Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation

路径锁定专家:通过架构层面分离实现混合思维中的推理模式分离

Shouren Wang, Wang Yang, Chuang Ma, Debargha Ganguly, Vikash Singh, Chaoda Song, Xinpeng Li, Xianxuan Long, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC, Japan(日本NII LLMC) Michigan State University(密歇根州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Path-Lock Expert,通过架构层面分离推理与非推理模式,减少推理泄漏,提升非推理模式的准确性和简洁性。

Comments 38 pages, 12 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01170 2026-08-07 cs.LG cs.AI cs.CL stat.AP stat.ML 版本更新 82%

Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning

在线推理校准:测试时训练使可泛化的符合性大语言模型推理

Cai Zhou, Zekai Wang, Menghua Wu, Qianyu Julie Zhu, Flora C. Shi, Chenyu Wang, Ashia Wilson, Tommi Jaakkola, Stephen Bates

机构 * Department of Electrical Engineering and Computer Science (MIT EECS)(麻省理工学院电气工程与计算机科学系) Computer Science and Artificial Intelligence Laboratory (MIT CSAIL)(麻省理工学院计算机科学与人工智能实验室) Laboratory for Information and Decision Systems (MIT LIDS)(麻省理工学院信息与决策系统实验室) Computational Science and Engineering (MIT CSE)(麻省理工学院计算科学与工程) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ORCA框架,通过测试时训练和符合性预测校准推理过程,提升大语言模型在分布变化下的效率和泛化能力,实验证明其在不同任务中具有更高的性能。

Comments Published as a conference paper at COLM 2026; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏