arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 20 篇

2605.07139 2026-05-11 cs.CL cs.AI cs.LG 87%

Structural Rationale Distillation via Reasoning Space Compression

通过推理空间压缩实现结构性理性提炼

Jialin Yang, Jiankun Wang, Jiajun Wu, Henry Leung, Jiayu Zhou, Steve Drew

机构 * University of Calgary(卡尔加里大学) University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出D-RPC方法,通过压缩推理空间约束教师模型生成一致且多样化的推理路径,提升学生模型在数学和常识推理任务中的表现,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV 85%

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13010 2026-05-11 cs.LG cs.AI 84%

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Lightning OPD: 为大推理模型高效实现离线在线蒸馏

Yecheng Wu, Song Han, Hai Cai

机构 * NVIDIA

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07686 2026-05-11 cs.LG 83%

The Coupling Tax: How Shared Token Budgets Undermine Visible Chain-of-Thought Under Fixed Output Limits

耦合税:共享令牌预算如何削弱固定输出限制下的思维链

Wenhua Nie, Junlin Liu, Jianan Wu, Zijie Meng, Yilong Fan, Zhang Zijian, Haoran Zheng, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 研究发现共享令牌预算会导致思维链推理效率下降,通过不同任务验证了耦合税现象,并提出分割预算生成作为缓解方法,提升数学任务准确率。

Comments 40 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07600 2026-05-11 cs.LG cs.AI cs.CL 82%

Mathematical Reasoning via Intervention-Based Time-Series Causal Discovery Using LLMs as Concept Mastery Simulators

通过基于干预的时间序列因果发现进行数学推理:利用LLMs作为概念掌握模拟器

Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CIKA框架,利用LLM自身作为干预模拟器,通过干预能力探针区分因果相关概念,提升数学推理能力。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 81%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 81%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 79%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI 79%

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06859 2026-05-11 cs.LG cs.AI 73%

Exact Is Easier: Credit Assignment for Cooperative LLM Agents

精确更简单:合作大语言模型代理的信用分配

Yanjun Chen, Yirong Sun, Hanlin Wang, Jinghan Wang, Xinming Zhang, Xiaoyu Shen, Wenjie Li, Wei Zhang

机构 * Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10693 2026-05-11 cs.LG cs.AI 73%

VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training

VESPO:变分序列级软策略优化用于稳定的反政策LLM训练

Guobin Shen, Chenxiao Zhao, Xiang Cheng, Lei Huang, Xing Yu

机构 * Xiaohongshu Inc(小红书公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VESPO,通过变分方法减少反政策更新中的方差,提升大语言模型在严重反政策条件下的稳定性,实验显示其在数学推理和代码生成任务中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07186 2026-05-11 cs.CL cs.AI 73%

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

文本恐怖谷:LLM信息检索中的非单调性能退化

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学) Northwestern University(西北大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07865 2026-05-11 cs.LG cs.AI cs.CL 67%

KL for a KL: On-Policy Distillation with Control Variate Baseline

KL 为 KL:带有控制变量基线的在线蒸馏

Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 62%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07331 2026-05-11 cs.LG cs.AI 62%

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

重新思考LLM策略优化中的重要性采样:从累积token视角

Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang

机构 * UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06755 2026-05-11 cs.LG cs.AI 62%

Gradient Extrapolation-Based Policy Optimization

基于梯度外推的策略优化

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) University of Maryland, College Park(马里兰大学学院公园分校) Illinois Institute of Technology(伊利诺伊理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GXPO算法,通过三步反向传播模拟多步前瞻,提升强化学习中大语言模型的推理能力,实验显示在数学推理任务中性能优于GRPO和SFPO。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01003 2026-05-11 cs.LG cs.AI 62%

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07051 2026-05-11 cs.CL 57%

NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models

NSMQ谜题:一个科学和数学谜题的基准,用于评估大型语言模型

George Boateng, Naafi Ibrahim, Samuel John, Philemon Badu, Patrick Agyeman-Budu, Jonathan Mensah, Kevin Yeboah, William Edor, Andrew Mensa-Onumah, Nana Yeboah, Victor Wumbor-Apin Kumbol

机构 * ETH Zurich(苏黎世联邦理工学院) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) Kwame AI Inc.(夸梅人工智能公司) Ashesi University(阿什西大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出NSMQ谜题基准,基于加纳国家科学与数学竞赛的谜题,评估大型语言模型的科学和数学推理能力,发现即使是最先进的模型也难以应对。

Comments 15 pages. Accepted at the 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21637 2026-05-11 cs.LG 57%

BoHA: Blockwise Hadamard Product Adaptation for Parameter-Efficient Fine-Tuning

BoHA:基于块状哈达玛积的参数高效微调

Feng Yu, Jia Hu, Geyong Min

机构 * Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 BoHA通过块状哈达玛积适配在参数受限下提升模型微调性能,保留初始任务表现,优于LoRA并在连续学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01535 2026-05-11 cs.SE 50%

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan

专题命中 数学推理 :reasoning(abstract)

AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。

Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same

Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏