arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3218 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2602.01207 2026-02-03 cs.AI 79%

Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models

并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐

Hui Wu, Hengyi Cai, Jinman Zhao, Xinran Chen, Ziheng Li, Zhejun Zhao, Shuaiqiang Wang, Yuchen Li, Dawei Yin

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Baidu Inc.(百度公司) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01204 2026-02-03 cs.CL 79%

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

ASTER: 基于工具集成扩展推理的代理扩展

Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22069 2026-02-03 cs.CL 79%

VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning

VTC-R1: 视觉-文本压缩用于高效长上下文推理

Yibo Wang, Yongcheng Jing, Shunyu Liu, Hao Guan, Rong-cheng Tu, Chengyu Wang, Jun Huang, Dacheng Tao

机构 * Nanyang Technical University(南洋技术大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。

Comments Code: https://github.com/w-yibo/VTC-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 79%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04120 2026-02-03 cs.CL 79%

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

RIDE: 通过项目反应理论进行数学推理的难度演变扰动

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23133 2026-02-02 cs.AI 79%

RAudit: A Blind Auditing Protocol for Large Language Model Reasoning

RAudit: 一种用于大语言模型推理的盲审协议

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RAudit通过盲审协议检测大语言模型推理中的问题,揭示了四个导致模型不可靠的机制,挑战了能力与鲁棒性之间的关系。

Comments 24 pages, 21 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00459 2026-02-02 cs.AI 79%

Thinking Machines: Mathematical Reasoning in the Age of LLMs

思考机器:在大语言模型时代中的数学推理

Andrea Asperti, Alberto Naibo, Claudio Sacerdoti Coen

机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。

Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18790 2026-01-27 cs.CL 79%

MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts

MortalMATH: 评估推理目标与紧急情境之间的冲突

Etienne Lanzeray, Stephane Meilliez, Malo Ruelle, Damien Sileo

机构 * Univ. Lille(里尔大学) Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12323 2026-01-27 cs.AI 79%

MARO: Learning Stronger Reasoning from Social Interaction

MARO:从社交互动中学习更强的推理能力

Yin Cai, Zhouhong Gu, Juntao Zhang, Ping Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MARO通过多智能体社交环境提升大语言模型的推理能力,解决稀疏信号、角色分布不均和环境不稳定问题,实验显示其在社交推理和跨任务迁移上的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25975 2026-01-27 cs.CL cs.PL 79%

SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation

SymCode:通过可验证代码生成实现数学推理的神经符号方法

Sina Bagheri Nezhad, Yao Li, Ameeta Agrawal

机构 * Portland State University(波特兰州立大学) ElastixAI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。

Comments camera-ready EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16007 2026-01-23 cs.CV cs.AI 79%

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试

Chak-Wing Mak, Guanyu Zhu, Boyi Zhang, Hongji Li, Xiaowei Chi, Kevin Zhang, Yichen Wu, Yangfan He, Chun-Kai Fan, Wentao Lu, Kuangzhi Ge, Xinyu Fang, Hongyang He, Kuan Lu, Tianxiang Xu, Li Zhang, Yongxin Ni, Youhua Li, Shanghang Zhang

机构 * Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学) Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL 79%

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07696 2026-01-13 cs.CL 79%

Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task

通过基于工具的多跳表格问答任务探索大型语言模型的元级推理

Nick Ferguson, Alan Bundy, Kwabena Nuamah

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07123 2026-01-13 cs.AI 79%

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning

ENTRA:基于熵的大型语言模型推理中的冗余避免

Ruichu Cai, Haopeng Du, Qingwen Lin, Yutong Chen, Zijian Li, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07038 2026-01-13 cs.AI 79%

Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning

工具增强的策略优化:通过强化学习协同推理与自适应工具使用

Wenxun Wu, Yuanyang Li, Guhan Chen, Linyue Wang, Hongyang Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 79%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03822 2026-01-08 cs.AI 79%

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

ROI-Reasoning: 为推理的理性优化 via 预计算元认知

Muyang Zhao, Qi Qi, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02397 2026-01-07 cs.AI 79%

OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation

OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理

Shengjia Zhang, Junjie Wu, Jiawei Chen, Changwang Zhang, Zhe Li, Xingyu Lou, Wangchunshu Zhou, Sheng Zhou, Can Wang, Jun Wang

机构 * Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24505 2026-01-01 cs.AI 79%

Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems

评估大语言模型在不常见数学竞赛问题上的推理能力

Samuel Golladay, Majid Bani-Yaghoub

机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。

Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06337 2026-01-01 cs.AI 79%

DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization

DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突

Xuan Xie, Xuan Wang, Wenjie Wang, Shuai Chen, Wei Lin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 79%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22774 2025-12-30 cs.LG cs.CV 79%

Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization

薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架

Truong Son Nguyen

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21540 2025-12-29 cs.AI 79%

Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model

Leash:自适应长度惩罚与奖励塑造用于高效大推理模型

Yanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo

机构 * Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19287 2025-12-23 cs.AI 79%

Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6

Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究

Jiaao Wu, Xian Zhang, Fan Yang, Yinpeng Dong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19093 2025-12-23 cs.AI 79%

Tool-Augmented Hybrid Ensemble Reasoning with Distillation for Bilingual Mathematical Problem Solving

工具增强的混合集成推理与蒸馏用于双语数学问题求解

Peiqing Lu, Yuan Zhang, Haoyun Zhang, Jiasen Zheng, Kejian Tong, Wenjun Wu

机构 * Boston University(波士顿大学) University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 HERALD通过结合自适应学习、工具强化学习和知识蒸馏,提升双语数学问题求解的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15489 2025-12-18 cs.AI 79%

Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision

Nemotron-Math:基于多模式监督的高效长上下文数学推理蒸馏

Wei Du, Shubham Toshniwal, Branislav Kisacanin, Sadegh Mahdavi, Ivan Moshkov, George Armstrong, Stephen Ge, Edgar Minasyan, Feng Chen, Igor Gitman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Nemotron-Math通过多模式监督和长上下文训练,实现了高效数学推理蒸馏,显著提升数学竞赛任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13978 2025-12-17 cs.AI 79%

Evaluating Frontier LLMs on PhD-Level Mathematical Reasoning: A Benchmark on a Textbook in Theoretical Computer Science about Randomized Algorithms

评估前沿大语言模型在博士级数学推理中的表现:一个关于随机算法理论教材的基准测试

Yang Cao, Yubin Chen, Xuyang Guo, Zhao Song, Song Yue, Jiahao Zhang, Jiale Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了前沿大语言模型在博士级数学推理中的表现,通过随机算法教材的基准测试,发现顶级模型在准确性上表现优异,但可靠性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02580 2025-12-16 cs.CL 79%

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务

Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * \equalcontrib(1号机构)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05943 2025-12-15 cs.AI 79%

TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models

TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架

Shima Imani, Seungwhan Moon, Lambert Mathias, Lu Zhang, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17114 2025-12-10 cs.AI 79%

Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models

数学证明作为检验标准:揭示先进大推理模型的失败模式

Dadi Guo, Jiayu Liu, Zhiyuan Fan, Zhitao He, Haoran Li, Yuxin Li, Yumeng Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过引入RFMDataset揭示大推理模型在数学证明中的失败模式,发现其在严谨性和正确性上的不足,需进一步提升逻辑训练。

详情

展开后加载摘要…

URL PDF HTML 收藏