arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 29 篇

2605.13511 2026-06-02 cs.CL cs.AI 90%

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

Many-Shot CoT-ICL: 使上下文学习真正学习

Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung

机构 * The University of Hong Kong(香港大学)

专题命中 数学推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究多示例思维链上下文学习在推理任务中的特性,提出曲线演示选择方法,在数学任务上提升5.42个百分点。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00206 2026-06-02 cs.LG 87%

Quantized Reasoning Models Think They Need to Think Longer, but They Do Not

量化推理模型认为它们需要思考更长时间,但实际上并不需要

Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

机构 * FAIR at Meta(Meta 联合实验室) Meta AI

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 本文发现后训练量化会降低推理模型准确率并增加思维链长度,通过分析量化模型在中间步骤正确但最终输出错误的“过度思考”错误,提出一种无训练的对过度思考标记施加logit惩罚的方法,在保持或提升准确率的同时减少12-23%的思维链长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02011 2026-06-02 cs.AI cs.LG 86%

Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

推理模型中的极端低位推理:失败模式与针对性恢复

Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在2位量化推理中因生成不稳定导致总token数膨胀而无法实现端到端加速的问题,提出轻量级FP16规划和循环救援两种控制方法,显著恢复模型精度并保持实际速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01934 2026-06-02 cs.LG cs.CL 86%

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO: 用于思维链压缩的混合中位数长度策略优化

Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

机构 * Li Auto Inc.(Li Auto公司)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 提出HMPO,一种单阶段强化学习框架,通过自适应中位数预算、余弦衰减令牌奖励和乘法奖励公式,在数学数据上训练后实现19%-46%的令牌压缩且精度损失极小,并泛化至多种任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21474 2026-06-02 cs.LG 85%

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation

d2: 通过轨迹似然估计改进扩散语言模型的推理能力

Guanghan Wang, Gilad Turok, Yair Schiff, Marianne Arriola, Volodymyr Kuleshov

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 提出d2框架,通过新的策略梯度算法和轨迹似然估计,显著提升扩散语言模型在逻辑与数学推理任务上的性能。

Comments ICML 2026. project page: https://guanghanwang.com/d2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02248 2026-06-02 cs.CL 83%

Geometric Latent Reasoning Induces Shorter Generations in LLMs

几何潜在推理诱导LLM生成更短的文本

Shashi Kumar, Yacouba Kaloga, Petr Motlicek, Ina Kodrasi, Andrea Cavallaro

机构 * Idiap Research Institute(日内瓦研究所) EPFL(苏黎世联邦理工学院) BUT(布拉格技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出几何潜在推理(GLR)方法,通过轻量级过渡头在嵌入空间中预测迭代方向更新,近似离散推理轨迹,从而在不显式优化长度的情况下显著缩短LLM的生成步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06948 2026-06-02 cs.CL 83%

Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning

超越两阶段训练:用于大语言模型推理的协作式SFT与RL

Liang Chen, Xueting Han, Li Shen, Jing Bai, Kam-Fai Wong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 提出BRIDGE框架,通过选择性知识迁移使SFT辅助RL训练,在数学推理等任务上优于两阶段和单阶段混合方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01682 2026-06-02 cs.CL cs.AI cs.LG 82%

Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning

现成的大语言模型作为过程评分器:数学推理中PRM的无训练替代方案

Atoosa Chegini, Soheil Feizi

机构 * Department of Computer Science, University of Maryland(马里兰大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Chunk-Level Guided Generation方法,利用现成的大语言模型作为过程评分器,通过固定长度块评分和对比选择规则,无需训练即可在数学推理中匹配或超越PRM引导搜索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00674 2026-06-02 cs.LG cs.AI 81%

The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs

结果优化的悖论:LLM中推理捷径的因果信息论界限

Zihan Chen, Yiming Zhang, Wenxiang Geng, Zenghui Ding, Yining Sun

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对基于结果强化学习的LLM在分布外任务中推理脆弱的问题,提出因果信息论框架解释奖励诱导的流形坍缩,并证明过程奖励模型作为拓扑滤波器可消除低复杂度捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12400 2026-06-02 cs.LG cs.AI 81%

OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning

OGLS-SD:基于结果引导的对数几率操控的在线自蒸馏用于大语言模型推理

Yuxiao Yang, Xiaoyun Wang, Weitong Zhang

机构 * UNC Chapel Hill(UNC夏洛特山分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出OGLS-SD框架,通过结果奖励校准教师对数几率,解决在线自蒸馏中师生响应模式不匹配导致的训练不稳定问题,提升数学推理性能。

Comments 17 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03259 2026-06-02 cs.LG cs.AI 81%

Verifying Meta-Awareness via Predictive Rewards in Reasoning Models

通过推理模型中的预测奖励验证元意识

Yoonjeon Kim, Doohyuk Jang, Eunho Yang

机构 * Yoonjeon Kim, Doohyuk Jang, Eunho Yang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 MAPR 方法,利用自生成任务预测推理统计量(长度、通过率、概念)来增强模型的元意识,从而在多个数学推理基准上显著提升准确率和训练效率。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00532 2026-06-02 cs.AI 79%

KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

KACE: 知识自适应上下文工程用于数学推理

Jayant Parashar, Suchendra M. Bhandarkar

机构 * School of Computing, University of Georgia(计算学院,佐治亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出KACE方法,通过难度和领域分层的知识库与分层自一致性,解决数学推理中上下文膨胀问题,在AIME 2025上达到62.2%准确率。

Comments 9 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL 75%

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25143 2026-06-02 cs.AI cs.LG 73%

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

超越前沿:用于高效测试时扩展的随机回溯

Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12652 2026-06-02 cs.LG cs.AI 73%

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

基于同伴成功与失败的多轨迹在线策略蒸馏

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Purdue University(普渡大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01828 2026-06-02 cs.MA cs.AI 70%

Dynamic Trust-Aware Sparse Communication Topology for LLM-Based Multi-Agent Consensus

基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识

Wanshuang Gou, Zihan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00172 2026-06-02 cs.AI 70%

CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转

Yang Li, Gongle Xue, Yijia Guo, Yuheng Yuan, Liwen Hu, Lei Ma

机构 * School of Software and Microelectronics, Peking University, Beijing(北京大学软件与微电子学院) School of Artificial Intelligence, Peking University, Beijing(北京大学人工智能学院) School of Computer Science, Peking University, Beijing(北京大学计算机科学学院) School of Future Technology, Peking University, Beijing(北京大学未来技术学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出CAST方法,通过无答案的自教师模型和双向局部优势符号翻转,解决GRPO中奖励稀疏和组相对优势消失的问题,提升数学推理性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09907 2026-06-02 cs.AI cs.MA 70%

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

RADAR:面向多智能体通信结构生成的冗余感知扩散方法

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。

Comments Accepted by ICML 2026 (fix typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02398 2026-06-02 cs.LG cs.CL 62%

A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

跨域干扰与恢复的局部微扰理论:多领域强化学习

Lei Yang, Siyu Ding, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院TJUNLP实验室) Baidu Inc.(百度公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对多领域RL训练中一个领域性能下降的问题,提出局部微扰理论,证明后期领域训练主要通过二阶损伤项在低维共享冲突子空间中损害早期领域,并通过短时领域刷新实现选择性恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01039 2026-06-02 cs.LG cs.AI 62%

OPD+: Rethinking the Advantage Design for On-Policy Distillation

OPD+: 重新思考在线策略蒸馏中的优势设计

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Meta Capital One

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPD+,通过修正在线策略蒸馏中因停止梯度操作导致的奖励目标偏差,并支持多种f-散度,在数学推理和工具使用基准上提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05395 2026-06-02 stat.ML cs.AI cs.LG 62%

Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers

用于高效推断一致LLM答案的最优贝叶斯停止

Jingkai Huang, Will Ma, Zhengyuan Zhou

机构 * Stern School of Business, New York University, New York, USA(纽约大学 Stern 商学院) Graduate School of Business, Columbia University, New York, USA(哥伦比亚大学 商学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 利用贝叶斯先验信息,通过L-聚合停止策略在达到足够一致性时提前停止采样,以最小化采样成本并高效识别最一致的LLM答案。

Comments Accepted to ICML 2026. Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02430 2026-06-02 cs.DC cs.AI 57%

Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference

并非所有错误都平等:大型语言模型推理中错误传播的系统研究

Yafan Huang, Sheng Di, Guanpeng Li

机构 * University of Iowa(爱荷华大学) Argonne National Laboratory(阿贡国家实验室) University of Florida(佛罗里达大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过提出的LLMFI故障注入框架,系统研究了软错误在大型语言模型推理中的传播机制,揭示了关键脆弱性模式,并提出了四种低开销的软件级可靠性改进方向。

Comments Accepted at ICS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-06-02 cs.CV cs.AI 57%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01053 2026-06-02 cs.AI 57%

AnyEdit++: Adaptive Long-Form Knowledge Editing via Bayesian Surprise

AnyEdit++: 基于贝叶斯惊讶的自适应长文本知识编辑

Bowen Tian, Caixue He, Jiemin Wu, Jingying Wang, Wenshuo Chen, Zexi Li, Yutao Yue

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AnyEdit++框架,通过基于贝叶斯惊讶的自适应分割机制Bayes-Chunk,实现结构感知的长文本知识编辑,在数学推理、代码生成和叙事任务上优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-06-02 cs.LG 57%

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11125 2026-06-02 cs.LG 57%

Language Modeling with Hyperspherical Flows

超球面流语言建模

Justin Deschenaux, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院) Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种在超球面潜空间中进行连续流语言建模的方法 S-FLM,通过旋转向量和交叉熵学习速度场,避免独热向量开销,在大型词汇推理任务上显著提升性能,缩小了与掩码扩散模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10014 2026-06-02 cs.LG stat.ML 57%

A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula

一种以任务为中心的迭代自改进理论,采用由易到难的课程

Chenruo Liu, Yijun Dong, Yiqiu Shen, Qi Lei

机构 * New York University(纽约大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文通过将自改进建模为基于奖励过滤分布的最大似然微调,推导了期望奖励的有限样本保证,并证明了在推理任务中由易到难的课程比固定任务混合训练具有更好的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14465 2026-06-02 cs.AI 57%

AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents

AgentProcessBench:诊断工具使用代理的步骤级过程质量

Shengda Fan, Xuyan Ye, Yupeng Huo, Zhi-Yuan Chen, Yiju Guo, Shenzhi Yang, Wenkai Yang, Shuqi Ye, Jingwen Chen, Haotian Chen, Xin Cong, Yankai Lin

机构 * Renmin University of China(中国人民大学) Beijing Jiaotong University(北京交通大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AgentProcessBench基准,通过三元标注方案和错误传播规则评估工具增强轨迹中的步骤级有效性,揭示当前模型在区分中立与错误动作方面的挑战,并证明过程信号对结果监督的补充价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03202 2026-06-02 cs.CL 57%

Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?

Code2Math:你的代码智能体能否通过探索有效演化数学问题?

Dadi Guo, Yuejin Xie, Qingyu Liu, Weixian Huang, Jiayu Liu, Zhiyuan Fan, Qihan Ren, Shuai Shao, Tianyi Zhou, Jianjie Feng, Wenze Su, Yujiu Yang, Dongrui Liu, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Nanjing Tech University(南京工业大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个多智能体框架,利用代码智能体通过探索将现有数学问题自主演化为更复杂、更困难的变体,并验证其可解性和难度提升。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏