OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
专题命中 数学推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL findings. https://github.com/FreedomIntelligence/OVM
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL findings. https://github.com/FreedomIntelligence/OVM
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI
Comments ACL 2023
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);verifier(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted by NLPCC2021
人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。
Comments Under review, 47 pages, 14 figures, 22 tables
为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆
机构 * University of Cambridge(剑桥大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。
推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过对比链式思维推理、单次代码执行和迭代代码执行三种方法在GSM-Symbolic数据集上的表现,发现代码执行并未提升大型语言模型在数学问题变体上的推理鲁棒性。
Comments 6 pages, 4 figures, 2 tables
最后的答案往往获胜:链式思维腐败研究中的格式混淆
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示链式思维腐败测试中,最终答案的位置影响准确性,而非中间计算步骤,提出新的研究协议以避免格式混淆。
Comments 34 pages, 6 figures, 13 tables. Submitted to NeurIPS 2026. Code and data: https://github.com/Gpgabriel25/LastWordWinsCoT
脆弱的思考:大型语言模型如何处理推理链扰动
机构 * University of Southern California(南加州大学) ; Information Sciences Institute(信息科学研究所)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。
多路思考:通过令牌级分支-合并进行推理
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
AI总结 多路思考是一种通过令牌级分支-合并机制实现软推理的新方法,能自适应地在离散和连续之间切换,从而在数学推理任务中优于传统CoT和RL基线。
Comments 21 pages. Code available at https://github.com/GMLR-Penn/Multiplex-Thinking
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; Zhejiang University(浙江大学) ; Ping An Technology (Shenzhen) Co., Ltd(平安科技(深圳)有限公司)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments NeurIPS 2025 Main Track
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);logical reasoning(abstract)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments 8 pages, ICML Neural Conversational AI workshop, thought experiments, moral reasoning
架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
AI总结 提出SWARR方法,通过监督微调将预训练自注意力模型高效转换为滑动窗口注意力,并利用强化学习策略适应,缩小了与自注意力的性能差距,同时保持线性复杂度的高效性。
重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架
机构 * Tel-Aviv University(特拉维夫大学) ; Amazon Prime Video(亚马逊Prime视频) ; Ben-Gurion University(巴内尔·戈里翁大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);logical reasoning(abstract);分类 cs.AI
AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。
大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL
AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。
Comments Accepted to ACL 2026 Findings
M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。
对齐基准:双语自反馈的多语言数学推理
机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL
AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。
Comments This paper has been accepted by ICASSP 2026
MedRule-KG:一种由知识图谱引导的轻量级验证器支持的数学推理框架
专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI
AI总结 MedRule-KG通过结合知识图谱和轻量级验证器,提升数学推理的准确性和规则一致性。
Comments This paper is withdrawn due to issues with attribution and citation accuracy
机构 * FusionBrain Lab(融合脑实验室) ; HSE University(俄罗斯高等经济学院) ; Innopolis University(因诺波利斯大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);chain-of-thought(abstract);分类 cs.LG
机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) ; Engineering Mechanics, Columbia University(哥伦比亚大学工程力学系) ; Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) ; Data Science Institute, Columbia University(哥伦比亚大学数据科学研究院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);verifier(abstract);分类 cs.AI
机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(中文大学多媒体实验室) ; Huawei Research(华为研究) ; BUAA(北京航空学院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL
Comments Project Page: https://mathcanvas.github.io/
机构 * Xi’an-Jiaotong Liverpool University(西交利物浦大学) ; University of Liverpool(利物浦大学) ; Duke Kunshan University(杜克昆山大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc(小红书公司)
专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL
Comments Accepted at ACL 2025 Findings
专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.LG
Comments aaai25(poster)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL
Comments 13 pages, 7 figures
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);CoT(abstract);分类 cs.AI
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);chain-of-thought(abstract);分类 cs.CL
Comments ACL 2024 Oral
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL
Comments ACL 2024. Code and data are available at https://github.com/TianduoWang/DPO-ST