arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2401.05190 2024-04-04 cs.CL 85%

DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs

Zijie Meng, Yan Zhang, Zhaopeng Feng, Zuozhu Liu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18295 2024-03-28 cs.CL 85%

Dual Instruction Tuning with Large Language Models for Mathematical Reasoning

Yongwei Zhou, Tiejun Zhao

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11467 2024-03-21 cs.CL 85%

Over-Reasoning and Redundant Calculation of Large Language Models

Cheng-Han Chiang, Hung-yi Lee

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments EACL 2024 main conference paper. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12822 2024-02-28 cs.CL 85%

Automatic Prompt Augmentation and Selection with Chain-of-Thought from Labeled Data

KaShun Shum, Shizhe Diao, Tong Zhang

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15585 2024-01-30 cs.CL 85%

Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting

Masahiro Kaneko, Danushka Bollegala, Naoaki Okazaki, Timothy Baldwin

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14628 2023-12-29 cs.CL 85%

Plan, Verify and Switch: Integrated Reasoning with Diverse X-of-Thoughts

Tengxiao Liu, Qipeng Guo, Yuqing Yang, Xiangkun Hu, Yue Zhang, Xipeng Qiu, Zheng Zhang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18170 2023-06-12 cs.CL 85%

Leveraging Training Data in Few-Shot Prompting for Numerical Reasoning

Zhanming Jie, Wei Lu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08061 2023-06-06 cs.CL 85%

On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning

Omar Shaikh, Hongxin Zhang, William Held, Michael Bernstein, Diyi Yang

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL

Comments ACL 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11364 2025-10-29 cs.LG cs.AI cs.CL 85%

Offline Learning and Forgetting for Reasoning with Large Language Models

Tianwei Ni, Allen Nie, Sapana Chaudhary, Yao Liu, Huzefa Rangwala, Rasool Fakoor

机构 * Mila - Quebec AI Institute & Université de Montréal(魁北克AI研究所与蒙特利尔大学) Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR), 2025. Code: https://github.com/twni2016/llm-reasoning-uft

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02061 2025-03-06 cs.LG cs.AI cs.CL 85%

Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models

Marianna Nezhurina, Lucia Cipolina-Kun, Mehdi Cherti, Jenia Jitsev

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments v3.0. Control experiments, further AIW problem versions, testing recent reasoning models. Short version appeared at NeurIPS Scientific Methods for Understanding Deep Learning Workshop (SciDL) 2024, https://openreview.net/forum?id=Mkl7dzjYiW

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20161 2026-07-21 cs.LG cs.AI cs.CL 版本更新 85%

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究部) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30852 2026-07-07 cs.AI cs.CL cs.LG 新提交 85%

When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models

何时学习停止有帮助?推理模型中早期退出的成本感知研究

Zhe Dong, Fang Qin, Manish Shah

机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 85%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09591 2026-06-11 cs.CL cs.AI cs.LG 版本更新 85%

On the Optimal Reasoning Length for RL-Trained Language Models

关于RL训练的语言模型的最优推理长度

Daisuke Nohara, Taishi Nakamura, Rio Yokota

机构 * University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00791 2026-06-11 cs.LG cs.AI cs.CL cs.LO 版本更新 85%

Geometry of Reason: Spectral Signatures of Valid Mathematical Reasoning

推理的几何:有效数学推理的谱特征

Valentin Noël

机构 * Valentin Noël(瓦伦丁·诺埃尔)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过将注意力矩阵视为加权词图,提取四个无需学习的谱诊断指标(Fiedler值、高频能量比、谱熵和平滑度),有效区分有效推理与模式匹配,在多个模型上达到85-96%的分类准确率。

Comments 30 pages, 13 figures, Accepted at ICML 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11609 2026-05-13 cs.LG cs.AI cs.CL 85%

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

反自我蒸馏用于通过点互信息的推理强化学习

Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14846 2026-04-21 cs.LG cs.AI cs.CL 85%

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21244 2026-04-21 cs.LG cs.AI cs.CL 85%

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

更少的噪声,更多的声音:通过指令净化进行推理的强化学习

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) Baidu Inc.(百度公司)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。

Comments Accepted at ACL 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV 85%

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06636 2026-04-09 cs.LG cs.AI cs.CL 85%

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理

Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu

机构 * Huawei Taylor Lab(华为泰勒实验室) Center for Data Science, Peking University(北京大学数据科学中心) Shanghai University of Finance and Economics(上海财经大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02322 2026-04-03 cs.LG cs.AI cs.CL 85%

Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning

批量上下文强化:一种任务扩展定律以实现高效推理

Bangji Yang, Hongbo Ma, Jiajun Fan, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出批量上下文强化方法,通过在共享上下文窗口中同时解决多个问题,实现高效推理,减少token消耗并提升准确性。

Comments 43 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG 85%

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12853 2026-03-30 cs.CL cs.AI cs.LG 85%

Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks

思想多样性在多智能体辩论框架中增强了推理能力

Mahmood Hegazy

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过多智能体辩论框架发现,思想多样性显著提升LLM推理能力,中等规模模型在GSM-8K基准测试中超越GPT-4,达到91%准确率,同时在ASDiv基准测试中创下新纪录。

Comments 11 pages, 9 figures

Journal ref Journal of Robotics and Automation Research(JRAR), Vol. 5 Issue 3, October -2024, pg. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04072 2026-03-19 cs.LG cs.AI cs.CL stat.ML 85%

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

慢-快策略优化:在更新前重新定位用于大语言模型推理

Ziyan Wang, Zheng Wang, Xingwei Qu, Qi Cheng, Jie Fu, Shengpu Tang, Minjia Zhang, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Manchester(曼彻斯特大学) NVIDIA Independent(独立) Emory University(埃默里大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 85%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02387 2026-03-09 cs.CL cs.AI cs.LG 85%

RM-R1: Reward Modeling as Reasoning

RM-R1: 作为推理的奖励建模

Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University(德克萨斯A&M大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RM-R1通过将奖励建模作为推理任务,提升模型的可解释性和性能,实验证明其在多个基准测试中表现优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13529 2026-02-26 cs.AI cs.CL cs.LG 85%

BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs

BARREL:面向事实性和可靠性的边界感知推理

Junxiao Yang, Jinzhe Tu, Haoran Liu, Xiaoce Wang, Chujie Zheng, Zhexin Zhang, Shiyao Cui, Caishun Chen, Tiantian He, Hongning Wang, Yew-Soon Ong, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,清华大学数据科学与技术研究院) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,高性能计算研究所,新加坡科技研究局) The College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARREL通过促进简洁且边界感知的事实推理,提升了大型推理模型的事实可靠性,实验显示其在可靠性方面有显著提升,同时保持了与传统微调模型相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07861 2026-02-17 cs.CL cs.AI cs.LG 85%

Scalable LLM Reasoning Acceleration with Low-rank Distillation

可扩展的大语言模型推理加速与低秩蒸馏

Harry Dong, Bilge Acun, Beidi Chen, Yuejie Chi

机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学) Meta FAIR at Meta(Meta FAIR) CMU(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01365 2026-02-03 cs.LG cs.AI cs.CL 85%

When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning

当领域互动时:强化学习中的非对称和顺序敏感的跨领域效应

Wang Yang, Shouren Wang, Chaoda Song, Chuang Ma, Xinpeng Li, Nengbo Wang, Kaixiong Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示GRPO在多领域训练中存在不对称性和顺序敏感性,指出训练顺序对推理性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22922 2026-01-27 cs.HC 85%

Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces

通过交互式解释界面提高LLM推理的人类验证

Runtao Zhou, Giang Nguyen, Nikita Kharya, Anh Totti Nguyen, Chirag Agarwal

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出三种交互式推理界面,通过增强用户对LLM推理过程的理解,提高人类验证效率和准确性。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏