arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-07 至 2026-07-07 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 19 篇

2606.30852 2026-07-07 cs.AI cs.CL cs.LG 新提交 85%

When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models

何时学习停止有帮助?推理模型中早期退出的成本感知研究

Zhe Dong, Fang Qin, Manish Shah

机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18814 2026-07-07 cs.LG cs.AI 版本更新 84%

A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

模型可以自我帮助:无需奖励的自我训练用于大语言模型推理

Mengqi Li, Lei Zhao, Anthony Man-Cho So, Ruoyu Sun, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SePT方法,通过自我生成和训练自我生成响应交替进行,无需外部奖励提升大语言模型推理性能,实验表明在多个数学推理基准上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05433 2026-07-07 cs.LG 83%

CRISP: Compressed Reasoning via Iterative Self-Policy Distillation

CRISP: 通过迭代自策略蒸馏实现压缩推理

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang, Jiachen Sun

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 CRISP通过自蒸馏使模型更简洁推理,无需真实答案或预算,在数学和多步骤规划任务中实现显著的token减少和精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11960 2026-07-07 cs.LG cs.AI cs.CL 版本更新 82%

R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning

R$^2$PO:用于大语言模型推理的解耦展开与推理策略

Jingchu Wang, Bingbing Xu, Yige Yuan, Dan Zhang, Bin Xie, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国家大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出强化学习方法中训练轨迹与推理响应策略耦合的问题,提出R$^2$PO解耦二者,在训练时多样化展开,保持推理生成不变,实验表明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07832 2026-07-07 cs.LG cs.AI 版本更新 81%

rePIRL: Learn PRM with Inverse RL for LLM Reasoning

rePIRL: 通过逆强化学习学习PRM以提高LLM推理

Xian Wu, Kaijie Zhu, Ying Zhang, Lun Wang, Wenbo Guo

机构 * Meta AI Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出rePIRL框架,通过逆强化学习学习高效的PRM,无需依赖专家策略的强假设,解决了传统方法中熵崩溃等固有限制问题,通过双学习过程和定制技术提升LLM推理性能,并在数学和编程任务数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26306 2026-07-07 cs.AI 版本更新 80%

Interactive Learning for LLM Reasoning

为LLM推理设计的交互学习

Hehai Lin, Shilei Cao, Sudong Wang, Haotian Wu, Minzhi Li, Linyi Yang, Juepeng Zheng, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ILR框架,通过动态交互和感知校准提升LLM独立问题解决能力,实验表明其在多个基准测试中优于单agent学习。

Comments The code is available at https://github.com/linhh29/Interactive-Learning-for-LLM-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04505 2026-07-07 cs.AI 新提交 79%

Why Pure Reasoning is Not Enough: Nature as the Source of Mathematical Innovation

为何纯推理不足:自然作为数学创新之源

Charanjit S. Jutla, Vimal Sharma

机构 * IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究认为人类数学推理受逻辑片段不可判定性和计算难题限制,依赖自然世界的模式匹配。通过追溯傅里叶变换等数学史及逻辑复杂性,表明物理启发的模式匹配是认知必要,为人工智能中语言模型规模大提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02869 2026-07-07 cs.LG 新提交 79%

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

强化学习中的奖励粒度:比较用于小语言模型数学推理的过程奖励和结果奖励结构

Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

机构 * New York University(纽约大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 研究在小语言模型中通过强化学习提升数学推理能力,系统比较五种奖励条件,发现过程奖励能显著提高准确率和推理痕迹保真度,奖励粒度是重要设计决策。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05184 2026-07-07 cs.AI cs.LG 新提交 73%

Rethinking On-Policy Self-Distillation for Thinking Models

重新思考思维模型的在线策略自蒸馏

Simran Kaur, Narutatsu Ri, Yinghui He, Liam Fowl, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Princeton Language and Intelligence(普林斯顿语言与智能实验室)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 73%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交 73%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05346 2026-07-07 cs.AI cs.MA 新提交 70%

OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement

OptiAgent:基于多智能体迭代精化的端到端优化建模

Adriana Laurindo Monteiro, Nayse Fagundes, Gabriel Mattos Langeloh, Gustavo de Oliveira Kanno, Priscila Louise Aguirre, Thiago Costa Rizuti da Rocha, Victor Leme Beltran

机构 * Instituto de Ciência e Tecnologia do Itaú(伊塔乌科技学院)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对运筹学问题自然语言描述转可求解数学形式与可执行代码的需求,OptiAgent采用多智能体迭代自校正与多回路验证架构,在多数优化任务基准上取得SOTA性能,建模过程可审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25996 2026-07-07 cs.AI cs.CL cs.LG 新提交 67%

Autodata: An agentic data scientist to create high quality synthetic data

Autodata: 一种创建高质量合成数据的智能数据科学家方法

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

机构 * Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05339 2026-07-07 cs.LG cs.AI stat.ML 新提交 62%

TREK: Distill to Explore, Reinforce to Refine

TREK:蒸馏以探索,强化以优化

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在学生策略覆盖外的难提示样本上失效问题,提出TREK方法,通过蒸馏扩展探索空间再结合GRPO优化,在多推理与智能体任务上大幅提升模型性能。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 62%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交 57%

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26997 2026-07-07 cs.DC cs.LG 新提交 57%

RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠

Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Southern University of Science and Technology(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对分离式RLVR系统中rollout与训练阶段空闲问题,提出RolloutPipe框架,通过完整组流水线(CGP)和前沿组调度(FGD)实现训练与rollout重叠,保持在线策略正确性,减少训练等待时间30.7%-42.3%。

Comments 15 pages

Journal ref Proceedings of the 2026 International Conference on Cognitive Computing (ICCC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00602 2026-07-07 cs.CL 版本更新 57%

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR: 开放式自我改进推理器

Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Imperial College London(伦敦帝国理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出OpenSIR框架,通过多样性奖励和难度校准实现开放式自我对弈,无需外部验证器或标注数据,在七个数学基准上平均提升指令模型3.6分、推理模型3.1分,且唯一能泛化到通用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13406 2026-07-07 cs.AI 57%

AutoMathKG: The automated mathematical knowledge graph based on LLM and vector database

AutoMathKG:基于LLM和向量数据库的自动化数学知识图谱

Rong Bian, Yu Geng, Zijian Yang, Bing Cheng

机构 * Academy of Mathematics and Systems Science(数学与系统科学研究院) Chinese Academy of Sciences(中国科学院) School of Mathematical Sciences(数学科学学院) University of Chinese Academy of Sciences(中国科学院大学) AMSS Center for Forecasting Science(数学与系统科学研究院预测科学中心) State Key Laboratory of Mathematical Science(数学科学国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoMathKG,一种高质、广覆盖、多维度的数学知识图谱,通过LLM和向量数据库实现自动更新与知识融合,实验显示其在可达性查询和数学推理方面表现优异。

Journal ref Computational Intelligence, vol. 41, no. 4 (2025): e70096

详情

展开后加载摘要…

URL PDF HTML 收藏