arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3218 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2601.05144 2026-04-02 cs.AI 79%

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25419 2026-03-27 cs.CL 79%

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

TAPO:多语言数学推理中的翻译增强策略优化

Xu Huang, Zhejian Lai, Zixian Huang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TAPO通过引入翻译增强策略优化框架,提升多语言数学推理能力,有效结合语言理解和推理能力,优于基线方法并在未见语言和领域任务中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 79%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG 79%

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16060 2026-03-20 cs.AI 79%

ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

ARISE: 在分层强化学习中通过内在技能进化实现智能体推理

Yu Li, Rui Miao, Zhengling Qi, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系) School of Business, George Washington University(乔治华盛顿大学商学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ARISE提出一种分层强化学习框架,通过共享策略管理高阶技能和生成低阶响应,提升数学推理能力,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14041 2026-03-17 cs.AI 79%

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

GRPO与反思奖励在大语言模型数学推理中的应用

Zhijie Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。

Journal ref Applied and Computational Engineering 154 161-166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00410 2026-03-17 cs.LG 79%

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

共奖励:用于大型语言模型中激发推理的稳定自监督强化学习

Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Co-rewarding框架,通过引入互补监督提升训练稳定性,通过对比一致性和模型蒸馏方法,在多个数学推理基准上实现性能提升,尤其在Llama-3.2-3B-Instruct上表现突出。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11193 2026-03-13 cs.CL 79%

DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning

DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理

Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich

机构 * University of Zurich(苏黎世大学) University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00997 2026-03-12 cs.AI 79%

IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch

IndiMathBench: 用人类触感实现数学推理问题的自动形式化

Param Biyani, Shashank Kirtania, Yasharth Bajpai, Sumit Gulwani, Ashish Tiwari

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 IndiMathBench通过人机协作管道形式化数学问题,提供具有挑战性的数学推理测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08743 2026-03-11 cs.DC cs.AI 79%

Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention

Zipage: 通过压缩分页注意力维持大语言模型推理的高请求并发性

Mengqi Liao, Lu Wang, Chaoyun Zhang, Bo Qiao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Zipage通过压缩分页注意力技术,在维持高并发的同时实现接近全KV推理性能的高效大语言模型推理

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05357 2026-03-06 cs.CL 79%

DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning

DiSCTT: 基于共识的自我课程学习用于推理中的高效测试时适应

Mohammad Mahdi Moradi, Sudhir Mudur

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DiSCTT通过动态分配测试时优化策略,提升推理模型在异质问题上的适应效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05120 2026-03-06 cs.AI 79%

Bidirectional Curriculum Generation: A Multi-Agent Framework for Data-Efficient Mathematical Reasoning

双向课程生成:一种用于数据高效数学推理的多智能体框架

Boren Hu, Xiao Liu, Boci Peng, Xinping Zhao, Xiaoran Shang, Yun Zhu, Lijun Wu

机构 * Zhejiang University(浙江大学) University of Macau(澳门大学) Peking University(北京大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出双向课程生成框架,通过多智能体系统动态生成数据以提升数学推理效率,优化学习轨迹并减少训练样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 79%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01641 2026-03-03 cs.AI 79%

Learning Structured Reasoning via Tractable Trajectory Control

通过可计算的轨迹控制学习结构化推理

Po-Nien Kung, Zhen Yang, Jeffrey Luo, Cheng-Fu Yang, Haikang Deng, Zi-Yi Dou, Yinfei Yang, Nanyun Peng, Zhe Gan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Ctrl-R通过可计算的轨迹控制学习结构化推理,提升复杂问题解决的多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02339 2026-03-03 cs.CL 79%

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

AStar: 通过自动化结构化思维提升多模态推理

Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22193 2026-02-26 cs.CL 79%

Improving Parametric Knowledge Access in Reasoning Language Models

提升推理语言模型的参数知识访问能力

Melody Ma, John Hewitt

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过强化学习训练,提升推理语言模型在参数知识访问上的能力,改进知识回忆和问答任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20904 2026-02-25 cs.LG 79%

Transcoder Adapters for Reasoning-Model Diffing

推理模型差分的转码适配器

Nathan Hu, Jake Ward, Thomas Icard, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 转码适配器用于分析推理模型微调前后的差异,揭示了推理训练对模型内部机制的影响,并展示了适配器在恢复推理准确性方面的有效性。

Comments 9 pages main, 27 pages total, 10 figures. Code and visualizations at https://transcoder-adapters.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01874 2026-02-25 cs.CV cs.AI 79%

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow:通过知识内化连接感知与推理以解决视觉数学问题

Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning Zhang, Yi Sun, Yi Yang, Hangjie Yuan

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18568 2026-02-25 cs.AR cs.AI 79%

RPU -- A Reasoning Processing Unit

RPU -- 一种推理处理单元

Matthew Adiletta, Gu-Yeon Wei, David Brooks

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RPU通过优化内存带宽和架构设计,显著提升了大型语言模型推理的性能和效率。

Comments To Appear in HPCA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20132 2026-02-24 cs.LG 79%

LAD: Learning Advantage Distribution for Reasoning

LAD: 为推理学习优势分布

Wendi Li, Sharon Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 LAD通过学习优势分布提升大型模型推理的多样性和准确性,无需额外训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24183 2026-02-24 cs.LG cs.AR cs.PL 79%

QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation

QiMeng-CodeV-R1: 基于推理增强的Verilog生成

Yaoyu Zhu, Di Huang, Hanqi Lyu, Xiaoyun Zhang, Chongxiao Li, Wenxuan Shi, Yutong Wu, Jianan Mu, Jinghua Wang, Yang Zhao, Pengwei Jin, Shuyao Cheng, Shengwen Liang, Xishan Zhang, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 QiMeng-CodeV-R1通过改进的RLVR框架,实现了基于推理增强的Verilog生成,提升了硬件描述语言生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20426 2026-02-17 cs.AI 79%

RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library

RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成

Jiapeng Wang, Jinhao Jiang, Zhiqiang Zhang, Jun Zhou, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Ant Group(蚂蚁集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11639 2026-02-13 cs.CL 79%

PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning

PACE: 用于高效推理的前缀保护和难度感知压缩

Ruixiang Feng, Yuntao Wen, Silin Zhou, Ke Shi, Yifan Wang, Ran Le, Zhenwei An, Zongchao Chen, Chen Yang, Guangyue Peng, Yiming Jia, Dongsheng Wang, Tao Zhang, Lisi Chen, Yang Song, Shen Gao, Shuo Shang

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanbeige Lab, BOSS Zhipin(纳米贝实验室,BOSS智联) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 PACE通过双层框架实现前缀保护和难度感知压缩,有效减少token使用并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11175 2026-02-13 cs.CL 79%

Barriers to Discrete Reasoning with Transformers: A Survey Across Depth, Exactness, and Bandwidth

Transformer在离散推理中的障碍:深度、精确性与带宽的跨领域综述

Michelle Yuan, Weiyi Sun, Amir H. Rezaeian, Jyotika Singh, Sandip Ghoshal, Yao-Ting Wang, Miguel Ballesteros, Yassine Benajiba

机构 * Oracle AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文综述了Transformer在离散推理任务中的理论限制,从电路复杂度、近似理论和通信复杂度三个角度分析了深度、精确性和带宽等障碍,并探讨了模型设计的改进方向。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 79%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09000 2026-02-10 cs.AI 79%

iGRPO: Self-Feedback-Driven LLM Reasoning

iGRPO:基于自我反馈的LLM推理

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han, Wei Ping, Yejin Choi, Jan Kautz

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06039 2026-02-06 cs.AI 79%

DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching

DyTopo:通过语义匹配实现多智能体推理的动态拓扑路由

Yuxing Lu, Yucheng Hu, Xukai Zhao, Jiuxin Cao

机构 * Peking University, Beijing, China(北京大学) Georgia Institute of Technology, Atlanta, United States(佐治亚理工学院) Southeast University, Location, Country(东南大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 DyTopo通过语义匹配实现多智能体推理的动态拓扑路由,提升多轮推理性能并提供可解释的协调轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04919 2026-02-06 cs.LG 79%

Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog

逐步压缩大型语言模型以像沸 frog 一样进行推理

Yiran Zhao, Shengyang Zhou, Zijian Wu, Tongyan Hu, Yuhui Xu, Rengan Dou, Kenji Kawaguchi, Shafiq Joty, Junnan Li, Michael Qizhe Shieh

机构 * Salesforce AI Research(Salesforce AI研究部) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04391 2026-02-05 cs.CL 79%

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

超越拒绝采样:轨迹融合用于扩展数学推理

Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TrajFusion通过融合错误与正确推理轨迹,改进数学推理微调,提升复杂问题表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01983 2026-02-03 cs.AI 79%

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中

Xintian Shen, Jiawei Chen, Lihao Zheng, Hao Ma, Tao Wei, Kun Zhan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏