rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);CoT(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);CoT(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI
Comments 9 pages, 1 figure, to be published in ACL 2024
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
Comments NAACL 2024 Long Paper; Code and data are available at https://github.com/Xuekai-Zhu/pad
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
Comments 14 pages, working in progress, Findings of EMNLP 2023
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
Comments 24 pages, 21 figures
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI
正确性不足:通过执行器导向的奖励训练推理计划器
机构 * D 4 Lab(D4实验室) ; Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,summary_cn);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TraceLift框架,通过执行器导向的奖励提升推理质量,利用rubric-based Reasoning Reward Model评估推理轨迹的可靠性与有效性。
Comments 36 pages
大型推理模型中的层次化思维建模
机构 * University of California, Riverside(加州大学河滨分校) ; Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)
AI总结 本文提出将大型推理模型(LRM)的层次化推理动态近似为有限状态机(FSM)中的轨迹,并通过Q值引导的推理时控制方法实现高效推理优化。
Comments Accepted in ICML 2026 as Oral
LEAD:高效适应性与动态推理用于大语言模型
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Emory University(埃默里大学) ; Individual Researcher(独立研究员) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; University of Florida(佛罗里达大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 LEAD通过动态校准正确性与效率的权衡,提升大语言模型的推理效率与准确性,实现更短的输出。
低资源东南亚语言中的原生多语言思维链推理
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。
Comments 22 pages, 16 figures, 12 tables
并非所有大语言模型的推理都能在思维链中体现
机构 * New York University(纽约大学) ; University of Maryland(马里兰大学) ; TogetherAI
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。
基于验证器的数学推理硬问题生成
机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) ; Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Department of Statistics, University of Oxford(牛津大学统计系)
专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。
跨语言的长链式推理
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了跨语言长链式推理能力的扩展机制,发现模型规模扩展提升En-CoT性能,但Target-CoT表现滞后,尤其在数学推理中更为明显。通过预训练和后训练优化,多语言模型在推理效率和稳定性上取得进展,同时揭示了语言特定的失败模式。
Comments Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025
机构 * Amazon AGI Foundations(亚马逊人工智能基础研究机构) ; Dartmouth College(达特茅斯学院) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear at EMNLP 2025
机构 * ServiceNow AI ; University of Washington(华盛顿大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at EMNLP Findings 2025; 21 pages, 3 figures
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)
Comments ICCV 2025
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2024 Main Conference
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 33 pages, 5 figures
并非所有错误都是同等重要:ASCoT解决高效大语言模型推理中的晚期脆弱性
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Institute of Automation, CASIA(中国科学院自动化研究所) ; Bytedance(字节跳动)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);self-correction(abstract)
AI总结 ASCoT通过自适应校正机制提升大语言模型推理效率与可靠性,减少计算资源消耗的同时保持高准确性。
自由能启发式:作为不确定精度下主动推理的快速节俭认知
机构 * Evolutionairy AI Toronto, Canada(进化人工智能(多伦多,加拿大))
专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 本文提出元不确定性决定链式思维(CoT)的效果:当模型对自身证据的可靠性高度不确定时,更多推理会降低准确率。通过自由能最小化策略证明,在重尾精度先验下,有限数量的高有效性线索后停止整合,与“取最优”启发式等价。实验验证了高元不确定性下长CoT导致准确率下降17.3个百分点。
Comments 64 pages, 6 figures
Nemotron-CrossThink: 在数学推理之外实现自学习的扩展
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出NEMOTRON-CROSSTHINK框架,通过整合多领域数据提升推理泛化能力,改进数学和非数学任务的准确性与效率。
Comments 19 pages, 10 figures
重新思考扩展测试时间计算时的微调:限制置信度可提升数学推理
机构 * Stanford University(斯坦福大学) ; University of Michigan(密歇根大学)
专题命中 数学推理 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG
AI总结 通过限制模型置信度改进数学推理,研究发现传统交叉熵损失与测试时间策略pass@N存在不一致,提出改进的训练损失以提升性能。
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI
机构 * Heidelberg University(海德堡大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);verifier(abstract);分类 cs.CL、cs.AI
机构 * University of Virginia(弗吉尼亚大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 38 pages, 54 figures, Accepted to ACL 2025 (Main)
机构 * Sun Yat-sen University(中山大学) ; China Agricultural University(中国农业大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Didichuxing Co. Ltd(滴滴出行公司) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.CL、cs.AI