arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2505.13308 2026-01-21 cs.LG cs.AI cs.CL 85%

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理

Hengli Li, Chenxi Li, Tong Wu, Xuekai Zhu, Yuxuan Wang, Zhaoxin Yu, Eric Hanchen Jiang, Song-Chun Zhu, Zixia Jia, Ying Nian Wu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13438 2025-11-10 cs.LG cs.AI cs.CL 85%

Optimizing Anytime Reasoning via Budget Relative Policy Optimization

Penghui Qi, Zichen Liu, Tianyu Pang, Chao Du, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(Sea AI实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19143 2025-10-28 cs.LG cs.AI cs.CL 85%

Thought Anchors: Which LLM Reasoning Steps Matter?

Paul C. Bogdan, Uzay Macar, Neel Nanda, Arthur Conmy

机构 * MATS

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paul C. Bogdan and Uzay Macar contributed equally to this work, and their listed order was determined by coinflip. Neel Nanda and Arthur Conmy contributed equally to this work as senior authors, and their listed order was determined by coinflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20571 2025-10-27 cs.LG cs.AI cs.CL 85%

Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Liyuan Liu, Baolin Peng, Hao Cheng, Xuehai He, Kuan Wang, Jianfeng Gao, Weizhu Chen, Shuohang Wang, Simon Shaolei Du, Yelong Shen

机构 * University of Washington(华盛顿大学) University of Southern California(南加州大学) Microsoft(微软) University of California, Santa Cruz(加州大学圣克鲁兹分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments link: https://github.com/ypwang61/One-Shot-RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19767 2025-10-23 cs.CL cs.AI cs.LG 85%

SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration

Xichen Zhang, Sitong Wu, Haoru Tan, Shaozuo Yu, Yinghao Zhu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/dvlab-research/SmartSwitch

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05095 2025-10-07 cs.LG cs.AI cs.CL 85%

From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models

Mingkang Zhu, Xi Chen, Bei Yu, Hengshuang Zhao, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14662 2025-09-19 cs.AI cs.CL cs.LG 85%

Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld's Episode Theory

Ming Li, Nan Zhang, Chenrui Fan, Hong Jiao, Yanbin Fu, Sydney Peters, Qingshu Xu, Robert Lissitz, Tianyi Zhou

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP2025 main, Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08940 2025-08-13 cs.CL cs.AI cs.LG 85%

Train Long, Think Short: Curriculum Learning for Efficient Reasoning

Hasan Abed Al Kader Hammoud, Kumail Alhamoud, Abed Hammoud, Elie Bou-Zeid, Marzyeh Ghassemi, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST), Saudi Arabia(卡布尔大学科学与技术大学) Massachusetts Institute of Technology (MIT), Cambridge, MA, USA(麻省理工学院) Princeton University, Princeton, NJ, USA(普林斯顿大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12507 2025-07-18 cs.LG cs.AI cs.CL 85%

Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training

Mingjie Liu, Shizhe Diao, Jian Hu, Ximing Lu, Xin Dong, Hao Zhang, Alexander Bukharin, Shaokun Zhang, Jiaqi Zeng, Makesh Narsimhan Sreedhar, Gerald Shen, David Mosallanezhad, Di Zhang, Jonas Yang, June Yang, Oleksii Kuchaiev, Guilin Liu, Zhiding Yu, Pavlo Molchanov, Yejin Choi, Jan Kautz, Yi Dong

机构 * NVIDIA

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06998 2025-06-10 cs.CL cs.AI cs.LG 85%

What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding

Ming Li, Zhengyuan Yang, Xiyao Wang, Dianqi Li, Kevin Lin, Tianyi Zhou, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20522 2025-06-10 cs.AI cs.CL cs.LG 85%

Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models

Jian Wang, Boyan Zhu, Chak Tou Leong, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09583 2025-06-05 cs.CL cs.AI cs.LG 85%

WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct

Haipeng Luo, Qingfeng Sun, Can Xu, Pu Zhao, Jianguang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Yansong Tang, Dongmei Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Microsoft Corporation(微软公司) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This paper has been accepted to ICLR 2025 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19162 2025-05-20 cs.CL cs.AI cs.LG 85%

SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning

Jiaqi Chen, Bang Zhang, Ruotian Ma, Peisong Wang, Xiaodan Liang, Zhaopeng Tu, Xiaolong Li, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tencent(腾讯) Tsinghua University(清华大学) MBZUAI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project webpage: https://chen-judge.github.io/SPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05408 2025-05-09 cs.CL cs.AI cs.LG 85%

Crosslingual Reasoning through Test-Time Scaling

Zheng-Xin Yong, M. Farid Adilazuarda, Jonibek Mansurov, Ruochen Zhang, Niklas Muennighoff, Carsten Eickhoff, Genta Indra Winata, Julia Kreutzer, Stephen H. Bach, Alham Fikri Aji

机构 * Brown University(布朗大学) MBZUAI Stanford University(斯坦福大学) University of Tübingen(图宾根大学) Capital One Cohere Labs(Cohere实验室)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02111 2025-04-04 cs.AI cs.CL cs.LG 85%

Exploring LLM Reasoning Through Controlled Prompt Variations

Giannis Chatziveroglou, Richard Yun, Maura Kelleher

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06772 2025-03-12 cs.CL cs.AI cs.LG 85%

ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Ling Yang, Zhaochen Yu, Bin Cui, Mengdi Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/Gen-Verse/ReasonFlux

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04813 2025-03-10 cs.LG cs.AI cs.CL 85%

Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models

Joykirat Singh, Tanmoy Chakraborty, Akshay Nambi

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03128 2025-03-06 cs.AI cs.CL cs.LG stat.ML 85%

Towards Understanding Multi-Round Large Language Model Reasoning: Approximability, Learnability and Generalizability

Chenhui Xu, Dancheng Liu, Jiajie Li, Amir Nassereldine, Zhaohui Li, Jinjun Xiong

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08348 2024-07-18 cs.AI cs.CL cs.LG 85%

Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On

Liang Zeng, Liangjun Zhong, Liang Zhao, Tianwen Wei, Liu Yang, Jujie He, Cheng Cheng, Rui Hu, Yang Liu, Shuicheng Yan, Han Fang, Yahui Zhou

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01991 2024-07-09 cs.CL cs.AI cs.LG 85%

Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems

Aniruddha Deb, Neeva Oza, Sarthak Singla, Dinesh Khandelwal, Dinesh Garg, Parag Singla

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06961 2024-06-11 cs.CL cs.AI cs.LG 85%

CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities

Yujun Mao, Yoon Kim, Yilun Zhou

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 (Findings). Project website at https://yujunmao1.github.io/CHAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01460 2023-11-03 cs.CL cs.AI cs.LG 85%

Implicit Chain of Thought Reasoning via Knowledge Distillation

Yuntian Deng, Kiran Prasad, Roland Fernandez, Paul Smolensky, Vishrav Chaudhary, Stuart Shieber

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00436 2023-10-06 cs.AI cs.CL cs.LG 85%

SelfCheck: Using LLMs to Zero-Shot Check Their Own Step-by-Step Reasoning

Ning Miao, Yee Whye Teh, Tom Rainforth

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新 84%

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12216 2025-06-04 cs.CL cs.LG 84%

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Siyan Zhao, Devaansh Gupta, Qinqing Zheng, Aditya Grover

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG

Comments 27 pages, project page at https://dllm-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14487 2022-03-29 cs.LG cs.AI 84%

Enhancing Neural Mathematical Reasoning by Abductive Combination with Symbolic Library

Yangyang Hu, Yang Yu

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

Comments Appeared in ICML 2020 Workshop on Bridge Between Perception and Reasoning: Graph Neural Networks & Beyond, Vienna, Austria, 2020. Code at https://agit.ai/Polixir/ABL-Sym | Video presentation available at https://slideslive.com/s/yangyang-hu-38188 | Online demonstration available at http://math.polixir.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04998 2026-08-04 cs.AI 84%

Mathematical Reasoning for Unmanned Aerial Vehicles: A RAG-Based Approach for Complex Arithmetic Reasoning

无人机数学推理:基于检索增强生成的方法用于复杂算术推理

Mehdi Azarafza, Mojtaba Nayyeri, Faezeh Pasandideh, Steffen Staab, Achim Rettberg

机构 * Department of Computer Science(计算机科学系) Institute For Artificial Intelligence(人工智能研究所) Hamm-Lippstadt University of Applied Sciences(哈姆-利普施塔特应用科学大学) University of Stuttgart(斯图加特大学)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI;logical reasoning(journal_ref)

AI总结 本文提出RAG-UAV框架,通过引入领域文献提升LLM在无人机任务中的数学推理能力,实验表明检索显著提高准确率并减少错误选择。

Comments 15 pages, 7 figures, 4 appendix subsections

Journal ref ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19728 2026-04-15 cs.LG 84%

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04226 2024-10-08 cs.CL 84%

Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula

Li Lucy, Tal August, Rose E. Wang, Luca Soldaini, Courtney Allison, Kyle Lo

专题命中 数学推理 :reasoning(title);math reasoning(title);分类 cs.CL

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12519 2026-08-07 cs.CL cs.AI 版本更新 84%

Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models

通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督

Kyuyoung Kim, Kevin Wang, Yunfei Xie, Peiyang Xu, Peiyao Sheng, Chen Wei, Zhangyang Wang, Jinwoo Shin, Pramod Viswanath, Sewoong Oh

机构 * KAIST AI(KAIST人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Rice University(里士满大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Sentient Labs(Sentient实验室)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏