arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2604.18584 2026-07-30 cs.AI cs.DL cs.IR cs.LG 版本更新 81%

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

MathNet:数学推理与检索的全球多模态基准

Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William T. Freeman, Antonio Torralba

机构 * MIT(麻省理工学院) KAUST(卡塔尔人工智能研究 institute) HUMAIN Individual Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。

Comments ICLR 2026; Website: http://mathnet.mit.edu

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20952 2026-07-28 cs.LG cs.CL 版本更新 81%

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

沉默的权重:潜在国际象棋推理中权重优于暂存器的因果案例

Ishan S. Kshirsagar

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究国际象棋模型潜在推理,通过分阶段潜在推理课程训练并强化学习,发现强化学习增加对干扰的鲁棒性而非依赖思维内容,反驳潜在思维是推理时暂存器的假设,表明其主要作用是塑造模型参数,还展示了强化学习在国际象棋领域的有效提升。

Comments 28 pages, 5 figures, preprint also available at Zenodo: https://zenodo.org/records/21619703 v2: added statistical significance testing on the n=1000 causal battery replication (Appendix A.8), added SVD-based weight-space rank analysis (Appendix A.11), corrected false-checkmate rate to reflect larger-sample data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17770 2026-07-27 cs.AI cs.CL 版本更新 81%

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

熵梯度反转:迈向大型推理模型的内部机制

Junyao Yang, Chen Qian, Kun Wang, Linfeng Zhang, Quanshi Zhang, Yong Liu, Dongrui Liu

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 81%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18199 2026-07-21 cs.CL cs.LG 新提交 81%

PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择

Hang Zhang, Warren J. Gross

机构 * McGill University(麦吉尔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究如何从语言建模到推理进行任务和预算感知的数据选择,提出PPL-Factory框架,结合任务感知困惑度得分与数据预算感知标准,实验表明该框架在GSM8K等任务上仅用少量训练集就能超越其他方法,有效提升微调效率。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03061 2026-07-21 cs.LG cs.AI math.ST stat.ME stat.ML stat.TH 版本更新 81%

Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals

评估LLMs在不知道答案时的性能:通过比较信号进行数学推理的统计评估

Zihan Dong, Zhixian Zhang, Yang Zhou, Can Jin, Ruijia Wu, Linjun Zhang

机构 * Rutgers University(罗格斯大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种统计高效的方法,通过结合标准结果与成对比较信号,提升LLM数学推理能力评估的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14332 2026-07-17 cs.CL cs.AI 版本更新 81%

Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring

步骤标记:通过步骤监控控制语言推理模型的生成

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(都柏林信任学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对语言推理模型效率低、过度生成推理步骤的问题,提出步骤标记框架,引入ReasonType分类法,可在线监控特定步骤计数以产生早期停止标准,经实验在保持准确性时减少令牌数,为控制模型生成及研究其行为提供新途径和工具。

Comments ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02244 2026-07-15 cs.LG cs.CL 版本更新 81%

Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models

在学习中保持好奇心:通过自适应自蒸馏实现熵保持的监督微调以提升大推理模型

Hao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue, Sirui Han, Yike Guo, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 CurioSFT通过自适应自蒸馏和熵引导温度选择,提升大推理模型的探索能力,在监督微调和强化学习阶段均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06855 2026-07-09 cs.LG cs.CL 新提交 81%

Geometric Self-Distillation for Reasoning Generalization

用于推理泛化的几何自蒸馏

Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(阿姆斯特丹大学伊利沙伯格学院) ILCC, University of Edinburgh(爱丁堡大学伊利沙伯格中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型特权上下文自蒸馏中监督难以信赖、导致分布外推理能力下降的问题,提出几何自蒸馏目标GeoSD,通过Hellinger损失和近端项对抗漂移,提升了模型分布外推理准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05992 2026-07-08 cs.CL cs.AI 新提交 81%

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

PluraMath:将数学推理评估扩展到资源丰富语言之外

Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) Applied AI Institute(应用人工智能研究所) Charles University(查尔斯大学) Nazarbayev University(纳扎尔拜大学) Inria(法国国家信息与自动化研究所) Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院) German University of Digital Science(德国数字科学大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对数学推理评估基准偏向高资源语言的问题,引入PluraMath,将其扩展到18种资源不足语言,通过人工策划构建数据集,对27个推理LLMs进行基准测试,分析性能差距,开源相关内容以推动多语言基准开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05861 2026-07-08 cs.CL cs.LG 新提交 81%

Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

Kaishen Wang, Tong Zheng, Xuehao Cui, Ruibo Chen, Tianyi Xiong, Heng Huang

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,College Park)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大型推理模型在面向事实问答中存在思维诱导幻觉的问题,提出MARGO框架,通过构建混合模式展开组评估思维价值,抑制幻觉思维,实验证明该方法在提升事实可靠性的同时保留了推理能力。

Comments 19 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07832 2026-07-07 cs.LG cs.AI 版本更新 81%

rePIRL: Learn PRM with Inverse RL for LLM Reasoning

rePIRL: 通过逆强化学习学习PRM以提高LLM推理

Xian Wu, Kaijie Zhu, Ying Zhang, Lun Wang, Wenbo Guo

机构 * Meta AI Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出rePIRL框架,通过逆强化学习学习高效的PRM,无需依赖专家策略的强假设,解决了传统方法中熵崩溃等固有限制问题,通过双学习过程和定制技术提升LLM推理性能,并在数学和编程任务数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18778 2026-07-01 cs.LG cs.CL 版本更新 81%

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

教模型自学:在可学习性边缘推理

Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe

机构 * MIT(麻省理工学院) Meta FAIR New York University(纽约大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出SOAR非对称自对弈框架,通过元强化学习生成自动课程,解决低初始成功率数据集上的推理模型扩展问题,发现基于学生进步的奖励优于内在可学习性奖励,且问题结构比答案正确性更重要。

Comments ICML 2026. Blog post: https://ssundaram21.github.io/soar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09883 2026-06-30 cs.LG cs.AI 81%

Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning

超越缩放定律:一种数据高效的蒸馏框架用于推理

Xiaojun Wu, Xiaoguang Jiang, Huiyang Li, Jucai Zhai, Dengfeng Liu, Qiaobo Hao, Huang Liu, Zhiguo Yang, Ji Xie, Ninglun Gu, Jin Yang, Kailai Zhang, Yelun Bao, Jun Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据高效的蒸馏框架DED,通过优化推理蒸馏的帕累托前沿,提升推理能力而不依赖大规模数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 81%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07031 2026-06-26 cs.CR cs.AI cs.CL 版本更新 81%

HauntAttack: When Attack Follows Reasoning as a Shadow

HauntAttack:当攻击如影随形地跟随推理

Jingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) StepFun Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 81%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11790 2026-06-24 cs.CL cs.AI 版本更新 81%

Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions

使用未见过的随机变量问题对LLM的数学推理进行基准测试

Zijin Hong, Hao Wu, Su Dong, Junnan Dong, Yilin Xiao, Yujing Zhang, Zhu Wang, Feiran Huang, Linyi Li, Hongxia Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Tencent Youtu Lab(腾讯优图实验室) Beihang University(北京航空航天大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22716 2026-06-23 cs.AI cs.CL 新提交 81%

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

超越惩罚错误:通过自适应仅正确奖励稳定大型推理模型的效率训练

Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

机构 * Korea University(高丽大学) Soongsil University(崇实大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对GRPO中长度惩罚导致奖励崩溃的问题,提出ACOER方法,通过仅对正确回答给予简洁奖励并动态调整预算,在数学推理任务中准确率提升且生成token减少超60%。

Comments 13 pages, 3 figures, 7 tables. Code: https://github.com/js-lee-AI/ACOER

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27568 2026-06-19 cs.AI cs.CL 版本更新 81%

SIGMA: Search-Augmented On-Demand Knowledge Integration for Agentic Mathematical Reasoning

SIGMA: 搜索增强的按需知识集成用于智能体数学推理

Ali Asgarov, Umid Suleymanov, Aadyant Khatri

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SIGMA框架,通过多智能体独立推理、定向搜索和协调机制,实现上下文敏感的知识集成,在MATH500等基准上提升7.4%的绝对性能。

Comments AAAI 2026 LMReasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21978 2026-06-19 cs.LG cs.AI 版本更新 81%

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

超越推理增益:缓解大型推理模型中的通用能力遗忘

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习训练导致推理模型遗忘基础能力的问题,提出RECAP重放策略,通过动态目标重加权在线调整训练重点,在保持通用能力的同时提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16934 2026-06-16 cs.CL cs.LG 新提交 81%

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

探索代码解释器有效推理的外在属性与内在属性

Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) Kasetsart University(科琼大学) SCB 10X King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) Cohere AI Singapore(AI新加坡)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15576 2026-06-16 cs.LG cs.AI 新提交 81%

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

在分歧处定位信用:路径条件自蒸馏用于LLM推理

Yu Li, Shu Hong, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Hindsight Self-Distillation (HSD)方法,通过将教师模型条件于当前训练组中的成功同伴轨迹,在失败与成功轨迹的分歧处提供密集信用信号,提升LLM在数学和代码推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15080 2026-06-16 cs.CL cs.AI 新提交 81%

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

AdaMame: 一种自适应多语言推理的训练方案

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09655 2026-06-16 cs.CL cs.LG 版本更新 81%

DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning

DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang, Haiyu Wu, Huayu Li, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(圣母大学) University of Arizona(亚利桑那大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17104 2026-06-16 cs.AI cs.CL cs.LO 版本更新 81%

Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving

迈向基于一阶逻辑定理证明的大语言模型高级数学推理

Chuxue Cao, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多步一阶逻辑数学推理中的困难,提出DREAM方法,通过公理驱动策略多样化和子命题错误反馈提升推理多样性和正确性,在定理证明数据集上性能提升0.6%-6.4%。

Comments Accepted by EMNLP 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03344 2026-06-10 cs.IR cs.AI cs.CL 版本更新 81%

RAG over Thinking Traces Can Improve Reasoning Tasks

RAG 基于思考轨迹可提升推理任务

Negar Arabzadeh, Wenjie Ma, Sewon Min, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10254 2026-06-10 cs.AI cs.CL 新提交 81%

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval:为何SOTA裁判难以应对真实人类推理

Yiteng Mao, Kenan Xu, Yijia Lyu, Wenhao Li, Jianlong Chen, Xiangfeng Wang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) East China Normal University(华东师范大学) New York University(纽约大学) Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出RealMath-Eval基准,评估LLM裁判对真实学生数学解答的评分能力,发现与人类评分存在高均方误差,而合成数据上表现更好,揭示评估差距源于人类错误空间的多样性和高信息熵。

Comments Code available at https://github.com/RicharMd/RealMath-Eval , Data available at https://huggingface.co/datasets/RicharMd/RealMath-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 81%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17196 2026-06-10 cs.LG cs.AI 81%

BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens

BudgetThinker: 通过控制令牌赋能预算感知的LLM推理

Hao Wen, Xinrui Wu, Yi Sun, Feifei Zhang, Liye Chen, Jie Wang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, Yuanchun Li

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究院(AIR)清华大学) Global Innovation Exchange & Department of Automation Tsinghua University(全球创新交流中心及自动化系 清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 BudgetThinker通过在推理过程中插入控制令牌,使LLM能够精确控制推理过程长度,采用两阶段训练流程提升模型在不同预算下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏