From Good to Great: Improving Math Reasoning with Tool-Augmented Interleaf Prompting
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
Comments 16 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
Comments 16 pages
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.LG
Comments Accepted to ICLR 2023
基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Soochow University(苏州大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。
Comments 16 pages, 5 figures
长周期推理代理用于竞赛级数学问题求解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; MMLab ; The Chinese University of Hong Kong(香港中文大学) ; ICMAT Spanish National Research Council(西班牙国家科研 council) ; The High School Affiliated to Renmin University of China(中国人民大学附属高中) ; Ren Hui Academy of Beijing(北京润辉学院)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。
从大型推理模型到紧凑学生模型的知识蒸馏:以约翰·O·布莱恩数学竞赛为例
机构 * Northern Kentucky University(北肯塔基大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文研究从大型推理模型DeepSeek-R1向紧凑学生模型Qwen2.5-7B的知识蒸馏,通过构建思维链训练语料库微调,使学生在竞赛数据集上准确率提升4.76个百分点,并发现响应长度对数学推理质量至关重要。
Comments 15 pages, 3 figures, 7 tables. Code and data available at https://github.com/TempGaurab/Distillation.John-O-Bryan
提炼精髓:通过序列截断的高效推理蒸馏
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; LinkedIn(领英)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出通过截断训练序列(仅保留前50%的token)进行知识蒸馏,在数学基准上保留约91%性能,同时减少约50%的训练时间、内存和FLOPs。
边推理边提问:将推理型大语言模型从被动求解者转变为主动询问者
机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Artificial Intelligence Research Institute(人工智能研究院) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of Texas, Dallas(德克萨斯大学达拉斯分校) ; University of Minnesota(明尼苏达大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出主动交互推理(PIR)范式,通过不确定性感知微调和用户模拟器策略优化,使LLM在推理中主动提问以澄清前提和意图不确定性,在数学推理、代码生成和文档编辑任务上显著提升准确率、通过率和BLEU值,同时减少近半推理计算和不必要交互。
Comments ACL Main Conference
ExpThink:基于经验的强化学习用于自适应思路链压缩
机构 * Baidu Inc.(百度公司) ; Shenzhen University(深圳大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。
Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication
VCORE: 基于方差控制的优化重加权用于链式推理监督
机构 * Shanghai Jiao Tong University(上海交通大学) ; Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。
Comments Accepted to ACL2026 Main Conference
AAPO: 通过优势边际增强大语言模型的推理能力
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Frontier Research Department, Baidu Inc.(百度公司前沿研究部)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 AAPO通过引入基于边际的估计方案优化交叉熵损失,有效解决传统分组相对优势估计方法的训练效率问题,在数学推理基准上表现出色。
Comments Accepted to ACL2026 Main Conference
这是思考还是作弊?通过测量推理努力来检测隐式奖励黑客
机构 * LMU Munich(慕尼黑莱茵河大学) ; New York University(纽约大学) ; MCML
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
AI总结 TRACE通过测量推理努力检测隐式奖励黑客,通过截断推理链并评估预期奖励来识别模型利用漏洞的行为,提升数学和编码任务的监控效果。
Comments ICLR 2026 Oral Presentation
潜在真实性推断用于识别逐步推理中的错误
机构 * Mila – Québec AI Institute(魁北克人工智能研究所) ; KAIST(韩国科学技术院) ; Université de Montréal(蒙特利尔大学) ; LawZero(法零)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
AI总结 本文提出通过引入潜在真实性变量和Veracity Search算法,提升语言模型在逐步推理中的准确性和可信度,并通过Amortized Veracity Inference实现零样本真实性推断。
用于推理中高效数据选择的影响函数
机构 * Mila, Québec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; Politecnico di Milano(米兰理工学院) ; Sage Group(Sage集团) ; Capital One
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
AI总结 本文提出通过影响函数定义推理数据质量,并引入基于影响的修剪方法,以提升数学推理性能。
Comments 4 pages, 2 figures; added link to codebase
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Michigan State University(密歇根州立大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments NeurIPS 2025
机构 * Computer Science and Engineering University of Michigan(计算机科学与工程系密歇根大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
Comments Camera ready version for NAACL 2025 Main
理解并缓解测试时间强化学习在数学推理中的虚假信号放大
机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Meituan(美团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。
Comments Accepted to ACL 2026 Findings
PCL-Reasoner-V1.5:通过离线强化学习推进数学推理
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 PCL-Reasoner-V1.5通过离线强化学习方法,在数学推理任务中达到新高度,实现90.9%和85.6%的准确率。
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG
Comments v2: fix bugs in Fig. 1
快速思考:估计前沿AI模型的无思维链任务完成时间范围
机构 * Redwood Research(红木研究) ; Astra Fellows Program(Astra 后援计划) ; Aether Research(Aether 研究) ; MATS Research(MATS 研究) ; Polytechnic University of Catalonia(加泰罗尼亚理工大学) ; Imperial College London(伦敦帝国理工学院) ; University of Cambridge(剑桥大学) ; University of Chicago(芝加哥大学) ; Durham University(杜伦大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学) ; University of Glasgow(格拉斯哥大学) ; Constellation(星座)
专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究通过超过3万个问题测试前沿AI模型在无思维链推理下的表现,估计其50%任务完成时间范围,发现该时间每约两年翻一番,GPT-5.5已达3分钟以上。
检测大语言模型中沉默推理失败的无参考分数
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.AI
AI总结 该研究针对大语言模型数学思维链评估的推理-答案一致性差距问题,提出无参考的RAFS分数,结合多维度指标诊断沉默推理与答案提取错误,相关研究在GSM8K、MATH数据集上开展验证。
大规模程序知识提升推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Meta FAIR
专题命中 数学推理 :reasoning(title,summary_cn);分类 cs.CL
AI总结 本研究提出Reasoning Memory框架,通过大规模检索增强生成方法,有效利用程序知识提升推理能力,在多个基准测试中表现优于现有方法。
Comments COLM 2026 Camera Ready
何时压缩有益,何时有害:链式思维蒸馏的条件感知分析
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工高等研究院,宁波) ; Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) ; The Hong Kong Polytechnic University(香港理工大学) ; LMU Munich(慕尼黑大学) ; Saarland University(萨尔大学)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 通过系统实验揭示链式思维蒸馏中压缩方法的关键因素:重要性准则的粒度、重构级别和压缩预算在不同领域和模式下的影响,并给出条件感知的部署指南。
DreamReasoner-8B:面向扩散推理模型的块大小课程学习
机构 * The University of Hong Kong(香港大学) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 提出块大小课程学习,通过从细粒度到粗粒度的渐进训练,解决块扩散语言模型在长链推理中性能差距问题,DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。
光学推理:重新思考图像作为超越文本的表达性推理媒介
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。
量化推理模型认为它们需要思考更长时间,但实际上并不需要
机构 * FAIR at Meta(Meta 联合实验室) ; Meta AI
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG
AI总结 本文发现后训练量化会降低推理模型准确率并增加思维链长度,通过分析量化模型在中间步骤正确但最终输出错误的“过度思考”错误,提出一种无训练的对过度思考标记施加logit惩罚的方法,在保持或提升准确率的同时减少12-23%的思维链长度。
顿悟时刻可以是假的吗?——量化思维链中的装饰性思考与真实思考
机构 * Northeastern University(东北大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.LG
AI总结 提出真实思考得分(TTS)量化思维链中每一步对最终答案的因果贡献,发现模型常混合真实思考与装饰性思考,并利用TTS实现有效剪枝与自训练,揭示前沿模型常表述未因果使用的推理步骤。
选择性潜在思考:LLM推理链的自适应压缩
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; School of Computing and Information Technology(计算与信息科技学院) ; Great Bay University(大湾大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 提出选择性潜在思考(SLT)框架,通过置信度门控将冗余推理步骤压缩为潜在表示,关键步骤保留显式思维链,在压缩比相当的情况下准确率比潜在推理基线高22.7%,推理链长度减少58.4%且准确率仅下降2.8%。
STOP:低数据场景下长形式推理的结构化在线剪枝
机构 * University of Washington(华盛顿大学) ; University of Montreal(蒙特利尔大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 STOP通过结构化在线剪枝减少低数据场景下的长形式推理生成token,同时保持准确性,提升推理效率与结构效率。
Comments 20 pages, 6 figures, 6 tables. Code available at: https://github.com/chenjux/ECN-STOP