arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2504.06460 2026-03-17 cs.CL 86%

Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context

LLMs能否通过反向表现模拟人物角色?一种针对数学推理情境中反事实指令跟随的系统性调查

Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出首个评估LLM反事实指令跟随能力的基准数据集,发现主流模型在模拟反向表现人物时表现不佳,揭示了反事实指令跟随的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18134 2026-02-13 cs.AI 86%

Evaluating LLM Reasoning Beyond Correctness and CoT

评估大语言模型推理能力超越正确性与链式思维

Soheil Abbasloo

机构 * Microsoft Research, Vancouver, Canada(微软研究院,温哥华,加拿大)

专题命中 数学推理 :reasoning(title,abstract);CoT(title);分类 cs.AI

AI总结 SIEV框架通过动态轨迹评估推理过程,揭示模型在面对冲突和挑战时的鲁棒性与综合能力,展现大语言模型推理能力的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19081 2025-12-23 cs.AI 86%

Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning

Population-Evolve: 一种用于LLM数学推理的并行采样和进化方法

Yanzhi Zhang, Yitong Duan, Zhaoxi Zhang, Jiyan He, Shuxin Zheng

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.AI

AI总结 Population-Evolve通过并行推理和进化提示提升LLM数学推理能力,实现高准确性和低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01363 2025-09-03 cs.CL 86%

Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic

Mohammad Zbeeb, Hasan Abed Al Kader Hammoud, Bernard Ghanem

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18824 2025-08-27 cs.CL 86%

Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness

Sirui Chen, Changxin Tian, Binbin Hu, Kunlong Chen, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01604 2025-08-05 cs.LG 86%

Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention

Xinhan Di, JoyJiaoW

机构 * Independent, Researcher, China(中国独立研究者)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.LG

Comments 7 pages, 1 table, accepted by SIM ICML@2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20808 2025-08-04 cs.AI 86%

MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts

Peijie Wang, Zhong-Zhi Li, Fei Yin, Xin Yang, Dekang Ran, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.AI

Comments 45 pages, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06877 2025-06-25 cs.CL 86%

Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning

Jiaxing Guo, Wenjie Yang, Shengzhong Zhang, Tongshan Xu, Lun Du, Da Zheng, Zengfeng Huang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19848 2025-05-27 cs.CL 86%

Improving Multilingual Math Reasoning for African Languages

Odunayo Ogundepo, Akintunde Oladipo, Kelechi Ogueji, Esther Adenuga, David Ifeoluwa Adelani, Jimmy Lin

机构 * The African Research Collective(非洲研究集体) Masakhane NLP University of Waterloo(滑铁卢大学) Mila, McGill University(Mila,麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12500 2025-05-20 cs.AI 86%

MARGE: Improving Math Reasoning for LLMs with Guided Exploration

Jingyue Gao, Runji Lin, Keming Lu, Bowen Yu, Junyang Lin, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息学院) Alibaba Group(阿里巴巴集团) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.AI

Comments To appear at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16788 2025-03-24 cs.AI 86%

Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study

Li Zhang, Longxi Gao, Mengwei Xu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12608 2024-12-18 cs.CL 86%

Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning

Vernon Y. H. Toh, Deepanway Ghosal, Soujanya Poria

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04857 2024-12-09 cs.AI 86%

Neuro-Symbolic Data Generation for Math Reasoning

Zenan Li, Zhi Zhou, Yuan Yao, Yu-Feng Li, Chun Cao, Fan Yang, Xian Zhang, Xiaoxing Ma

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.AI

Comments Published as a conference paper at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07945 2024-07-02 cs.CL 86%

First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoning

Kushal Jain, Moritz Miller, Niket Tandon, Kumar Shridhar

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16265 2024-06-27 cs.LG 86%

MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time

Jikun Kang, Xin Zhe Li, Xi Chen, Amirreza Kazemi, Qianyi Sun, Boxing Chen, Dong Li, Xu He, Quan He, Feng Wen, Jianye Hao, Jun Yao

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08190 2024-02-23 cs.CL 86%

MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline

Minpeng Liao, Wei Luo, Chengxi Li, Jing Wu, Kai Fan

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11408 2026-07-14 cs.CL cs.AI 86%

KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?

KisMATH: 大型语言模型是否具有数学推理中隐含结构的知识?

Soumadeep Saha, Akshay Chaturvedi, Saptarshi Saha, Utpal Garain, Nicholas Asher

机构 * ISI Kolkata, India(印度 ISI 学院) IRIT(IRIT 研究所) LINAGORA Labs(LINAGORA 实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 KisMATH通过构建因果链式思维图,研究大型语言模型在数学推理中隐含结构的知识与因果依赖关系。

Comments Pre-print; Accepted to TACL

Journal ref Transactions of the Association for Computational Linguistics (2026) 14

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06447 2026-07-09 cs.AI cs.CL cs.MA 新提交 86%

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

Danus:利用事实图内存编排数学推理智能体

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) School of Mathematics, Tianjin University(天津大学数学学院) Zhongguancun Academy(中关村科学院) Department of Mathematics, Stanford University(斯坦福大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15631 2026-07-08 cs.LG cs.AI 版本更新 86%

The relationship between reasoning and performance in large language models--o3 (mini) thinks harder, not longer

大语言模型中推理与性能的关系——o3(mini)思考更深入,而非更久

Marthe Ballon, Andres Algaba, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理与性能的关系,在Omni - MATH基准上分析o1 - mini和o3 - mini变体推理链长度,发现o3 - mini(m)无需更长推理链就能实现更高准确率,还表明推理链增长时准确率通常下降,为模型能力与推理长度关系提供新见解。

Comments 19 pages, 14 figures. Sci Rep (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30128 2026-06-30 cs.AI cs.CL 86%

Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters

冗长的思维链真的有用吗?来自分布内证据表明,内容而非长度才是关键

Wenlong Wang, Fergal Reid

机构 * Fin AI Research(Fin AI研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 通过分布内采样和受控干预实验,发现思维链中额外标记的长度不影响推理准确性,真正起作用的是标记携带的推理和验证内容。

Comments ICML Workshop on Efficient Multimodal Question Answering (EMM-QA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09410 2026-06-09 cs.AI cs.CL 新提交 86%

Capacity, Not Format: Rethinking Structured Reasoning Failures

容量而非格式:重新思考结构化推理失败

Hengxin Fan

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现结构化格式对模型性能的影响取决于其空闲容量,容量不足时通过截断和纯容量竞争两种机制导致性能下降,建议先思考后格式化。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02880 2026-06-09 cs.AI cs.CL 版本更新 86%

ReTreVal: Reasoning Tree with Validation and Cross-Problem Memory for Large Language Models

ReTreVal:带有验证和跨问题记忆的推理树

Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

机构 * QpiAI

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ReTreVal通过自适应树探索、带工具增强的节点细化、类型化失败回溯和自修改记忆,使大语言模型在无需微调的情况下实现跨问题学习,其在MATH-500上达到85.8%的pass@1准确率,在MMLU-Pro上达到54.4%的准确率。

Comments 15 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05315 2026-06-05 cs.CL cs.AI 86%

LoRi: Low-Rank Distillation for Implicit Reasoning

LoRi: 用于隐式推理的低秩蒸馏

Ryan Solgi, Jiayi Tian, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 提出低秩蒸馏框架,通过对齐师生模型在共享低秩张量子空间中的隐状态推理轨迹,提升大型语言模型的隐式思维链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02011 2026-06-02 cs.AI cs.LG 86%

Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

推理模型中的极端低位推理:失败模式与针对性恢复

Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在2位量化推理中因生成不稳定导致总token数膨胀而无法实现端到端加速的问题,提出轻量级FP16规划和循环救援两种控制方法,显著恢复模型精度并保持实际速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01934 2026-06-02 cs.LG cs.CL 86%

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO: 用于思维链压缩的混合中位数长度策略优化

Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

机构 * Li Auto Inc.(Li Auto公司)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 提出HMPO,一种单阶段强化学习框架,通过自适应中位数预算、余弦衰减令牌奖励和乘法奖励公式,在数学数据上训练后实现19%-46%的令牌压缩且精度损失极小,并泛化至多种任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28247 2026-05-28 cs.LG cs.AI 86%

IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

IRDS: 通过验证器耦合的稀疏自编码器覆盖实现可解释的RLVR数据选择

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出IRDS方法,基于稀疏自编码器簇和验证器耦合的覆盖目标,选择模型失败但可学习的RLVR训练实例,提升数学推理准确率并降低计算成本。

Comments 24 pages,3 figures,18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19338 2026-05-20 cs.MA cs.AI cs.CL 86%

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

STAR-PólyaMath: 多智能体在持久元策略监督下的推理

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) New York University(纽约大学) MIT(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STAR-PólyaMath多智能体框架,通过元级监督和结构化的推理-验证交互系统性解决数学推理中的幻觉积累、记忆碎片化和推理工具平衡问题,并在多个顶级竞赛基准上取得最佳成绩。

Comments 25 pages, 4 figures. Code: https://github.com/Julius-Woo/STAR-PolyaMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11991 2026-05-04 cs.CV cs.AI cs.CL 86%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06853 2026-03-31 cs.CL cs.LG 86%

†DAGGER: Distractor-Aware Graph Generation for Executable Reasoning in Math Problems

†DAGGER:面向数学问题可执行推理的干扰意识图生成

Zabir Al Nazi, Shubhashis Roy Dipta, Sudipta Kar

机构 * University of California, Riverside(加州大学河滨分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Oracle Health AI(甲骨文健康AI)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出†DAGGER,通过将数学问题解决转化为可执行计算图生成,提升在低资源和噪声环境下的推理鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27419 2026-03-24 cs.AI cs.CL 86%

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

DeepCompress:一种双奖励策略用于动态探索和压缩推理链

Tian Liang, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏