arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2605.11906 2026-05-13 cs.CL 83%

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

YFPO:一种基于神经引导奖励的数学推理的初步研究

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。

Comments 10 pages, 2figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06241 2026-05-12 cs.CL 83%

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

重新思考LLM推理中的强化学习:不是能力学习,而是稀疏策略选择

Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL ReasonMaxxer

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文通过分析发现强化学习在LLM推理中主要通过稀疏修正提升性能,提出无需强化学习的ReasonMaxxer方法,仅需少量基础模型推理即可达到与强化学习相当的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07686 2026-05-11 cs.LG 83%

The Coupling Tax: How Shared Token Budgets Undermine Visible Chain-of-Thought Under Fixed Output Limits

耦合税:共享令牌预算如何削弱固定输出限制下的思维链

Wenhua Nie, Junlin Liu, Jianan Wu, Zijie Meng, Yilong Fan, Zhang Zijian, Haoran Zheng, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 研究发现共享令牌预算会导致思维链推理效率下降,通过不同任务验证了耦合税现象,并提出分割预算生成作为缓解方法,提升数学任务准确率。

Comments 40 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00677 2026-05-04 cs.LG 83%

Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game

通过混淆的自然数游戏评估大语言模型证明者的架构推理能力

Lixing Li

机构 * Lixing Li(李立星)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文通过混淆的自然数游戏评估大语言模型的架构推理能力,发现推理模型在无语义线索下仍保持准确率,为数学推理能力提供了量化评估标准。

Comments 4 pages. Accepted as a short paper to the AAAI 2026 Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents (MAKE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL 83%

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21593 2026-04-24 cs.CL 83%

Language as a Latent Variable for Reasoning Optimization

语言作为潜在变量用于推理优化

Linjuan Wu, Haoran Wei, Jialong Tang, Shuang Luo, Baosong Yang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨语言作为潜在变量对推理性能的影响,提出polyGRPO框架通过多语言数据优化模型,提升推理准确率和跨任务泛化能力。

Comments 17 pages, 7 figures, Under Reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17957 2026-04-21 cs.CL 83%

Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards

过程奖励模型与规划:生成精确且可扩展的步骤级奖励数据集

Raffaele Pisano, Roberto Navigli

机构 * Babelscape Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 数学推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出基于规划逻辑问题生成过程奖励模型数据集的方法,通过PDDL领域定义语言生成百万级推理步骤,提升数学和非数学推理能力。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17696 2026-04-21 cs.AI 83%

Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play

战略:通过轨迹调节的游戏自我对战学习可转移的推理

Xiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Qiming Li, Yuxuan Gu, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STRATAGEM,通过轨迹调节游戏自我对战学习可转移的推理,解决领域特定性和上下文停滞问题,提升数学推理和代码生成等任务的性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09354 2026-04-21 cs.CL 83%

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

逻辑运算激发长推理能力而不需训练

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出ThinkLogit方法,通过逻辑运算将小型推理引导器的能力转移至大模型,无需训练即可提升推理性能,实验显示在六个基准测试中实现21.5%-24.2%的提升。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02113 2026-04-03 cs.CL 83%

Reliable Control-Point Selection for Steering Reasoning in Large Language Models

用于大语言模型转向推理的可靠控制点选择

Haomin Zhuang, Hojun Yoo, Xiaonan Luo, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出稳定过滤方法,通过概率模型识别稳定的行为边界,提升转向向量的稳定性与准确性,在MATH-500数据集上取得0.784准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19835 2026-04-01 cs.LG 83%

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

FIPO:通过未来KL影响的策略优化激发深度推理

Chiyu Ma, Shuo Yang, Kexin Huang, Jinda Lu, Haoming Meng, Shangshang Wang, Bolin Ding, Soroush Vosoughi, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 FIPO通过引入折扣后的未来KL散度,改进策略更新,使模型突破传统基线的长度停滞,提升推理能力与准确率。

Comments Move related work to main paper, and add one more background information in Preliminary section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27008 2026-03-31 cs.CL 83%

RASPRef: Retrieval-Augmented Self-Supervised Prompt Refinement for Large Reasoning Models

RASPRef: 用于大型推理模型的检索增强自监督提示精炼

Rahul Soni

机构 * Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 RASPRef通过检索相关示例和推理轨迹,利用多样本一致性、验证反馈和模型生成的批评信号,迭代优化提示,提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03975 2026-03-05 cs.AI cs.CV 83%

Phi-4-reasoning-vision-15B Technical Report

Phi-4-reasoning-vision-15B 技术报告

Jyoti Aneja, Michael Harrison, Neel Joshi, Tyler LaBonte, John Langford, Eduardo Salinas

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Phi-4-reasoning-vision-15B 是一个紧凑型开放式权重多模态推理模型,通过系统数据处理和架构优化,在减少计算资源的同时实现高效推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12164 2026-02-13 cs.AI 83%

Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse Supervision

Sci-CoE: 通过稀疏监督与几何共识共演化科学推理LLM

Xiaohan He, Shiyang Feng, Songtao Huang, Lei Bai, Bin Wang, Bo Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 Sci-CoE 通过稀疏监督与几何共识共演化科学推理LLM,提升复杂推理能力与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07820 2026-02-10 cs.AI 83%

Guideline Forest: Retrieval-Augmented Reasoning with Branching Experience-Induced Guidelines

指南森林:基于检索的增强推理与分支经验引导

Jiaxiang Chen, Zhuo Wang, Mingxi Zou, Qifan Wang, Zenglin Xu

机构 * Fudan University(复旦大学) Meta SAIS SII

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 Guideline Forest通过利用经验引导多步骤推理,提升数学和编程任务的推理能力,支持多模型协作与灵活扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19326 2026-02-04 cs.CL 83%

Slot Filling as a Reasoning Task for SpeechLLMs

槽填充作为推理任务用于语音大语言模型

Kadri Hacioglu, Manjunath K E, Andreas Stolcke

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出通过推理任务提升语音大语言模型在槽填充任务中的性能,探讨了不同基础模型对推理语音LLM的影响。

Journal ref Proc. IEEE ICASSP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15522 2026-02-02 cs.CL 83%

LLM Latent Reasoning as Chain of Superposition

LLM潜在推理作为叠加链

Jingcheng Deng, Liang Pang, Zihao Wei, Shicheng Xu, Zenghao Duan, Kun Xu, Yang Song, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出Latent-SFT框架,通过约束隐藏状态、构建语义紧凑的链结构以及使用随机Gumbel-Softmax优化,实现LLM潜在推理的高效叠加,提升数学基准任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18196 2026-01-30 cs.CL 83%

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

LogicReward: 通过逐步逻辑监督激励大语言模型推理

Jundong Xu, Hao Fei, Huichi Zhou, Xin Quan, Qijun Huang, Shengqiong Wu, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) University of Melbourne(墨尔本大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 LogicReward通过逐步逻辑监督提升大语言模型的推理能力,有效增强推理可信度和泛化能力,实验显示其在自然语言推理和逻辑推理任务中优于GPT-4o和o4-mini。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03823 2026-01-08 cs.CL 83%

Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning

阶梯势能优势估计:利用中间置信度和正确性以实现高效的数学推理

Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出阶梯势能优势估计(SPAE)方法,通过提取中间置信度和正确性,实现高效数学推理的细粒度信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24297 2026-01-07 cs.CL 83%

Figure It Out: Improve the Frontier of Reasoning with Executable Visual States

图中找出:通过可执行的视觉状态提升推理边界

Meiqi Chen, Fandong Meng, Jie Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 FIGR通过可执行的视觉构建提升复杂推理能力,优于文本-only基线,在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01170 2025-12-17 cs.AI 83%

DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models

DART: 为高效大语言模型的难度自适应推理截断

Ruofan Zhang, Bin Xia, Zhen Cheng, Cairen Jian, Minglun Yang, Ngai Wong, Yuan Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CSE Department, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Research and Development Department, SIMMIR Tech(Simmir科技研发部) School of Information Science and Technology, Xiamen University Tan Kah Kee College(厦门大学信息科学与技术学院) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 DART通过自适应调整推理长度提升大语言模型效率,实现81.2%的推理截断和5.33倍的计算加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05502 2025-12-08 cs.LG 83%

GRASP: Graph Reasoning Agents for Systems Pharmacology with Human-in-the-Loop

GRASP:具有人机交互循环的图推理代理用于系统药理学

Omid Bazgir, Vineeth Manthapuri, Ilia Rattsev, Mohammad Jafarnejad

机构 * Clinical Pharmacology, Genentech(基因泰克临床药理部) Preclinical & Translational PKPD, Genentech Inc.(基因泰克预临床与转化药代动力学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.LG

AI总结 GRASP通过图推理代理实现系统药理学模型开发的自动化与严谨性,提升生物医学建模的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14258 2025-11-25 cs.CL 83%

Entropy-Guided Reasoning Compression

熵引导的推理压缩

Hourun Zhu, Yang Gao, Wenlong Fei, Jiawei Li, Huashan Sun

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出熵引导的推理压缩框架,通过平衡熵变化引导模型在高效推理与探索之间取得平衡,实验表明在保持准确性的同时将推理长度压缩至原始的20%。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18617 2025-11-25 cs.CR cs.LG 83%

DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs

DarkMind: 自定义大语言模型中的潜在推理链后门

Zhen Guo, Shanghao Shi, Shamim Yazdani, Ning Zhang, Reza Tourani

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 DarkMind是一种针对定制化大语言模型的潜在推理链后门攻击,通过操纵内部推理步骤实现隐蔽攻击,展示了高攻击成功率并揭示了推理层面安全威胁的紧迫性。

Comments 19 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09865 2025-11-14 cs.CL 83%

In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback

Mingye Zhu, Yi Liu, Zheren Fu, Quan Wang, Yongdong Zhang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08022 2025-11-12 cs.AI 83%

Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models

Zhishen Sun, Guang Dai, Ivor Tsang, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室) A*STAR

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27072 2025-11-03 cs.LG 83%

Towards Understanding Self-play for LLM Reasoning

Justin Yang Chae, Md Tanvirul Alam, Nidhi Rastogi

机构 * University of Washington(华盛顿大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24550 2025-10-21 cs.CL 83%

A*-Thought: Efficient Reasoning via Bidirectional Compression for Low-Resource Settings

Xiaoang Xu, Shuo Wang, Xu Han, Zhenghao Liu, Huijia Wu, Peipei Li, Zhiyuan Liu, Maosong Sun, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Northeastern University(东北大学) Institute for AI, Tsinghua University(清华大学人工智能研究院) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16476 2025-10-21 cs.AI 83%

NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13003 2025-10-07 cs.AI 83%

EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing

Shengbo Wang, Mingwei Liu, Zike Li, Anji Li, Yanlin Wang, Xin Peng, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏