Modeling Complex Mathematical Reasoning via Large Language Model based MathAgent
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments There are unfair comparisons on miniF2F. This will be fixed in the future
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments There are unfair comparisons on miniF2F. This will be fixed in the future
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Published at TMLR 2023
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
机构 * University of Amsterdam(阿姆斯特丹大学) ; Meta FAIR ; New York University(纽约大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
机构 * Shanghai Jiao Tong University SII GAIR Lab(上海交通大学SII GAIR实验室)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments 26 pages; The first three authors contribute to this work equally
ThinkRetrieve:用于测试时缩放的检索增强推理轨迹
机构 * IIT Bombay(印度理工学院孟买分校) ; University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(奥多比研究院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 针对大型推理模型测试时缩放的负面效果,提出ThinkRetrieve框架,通过每步动态检索已解决示例注入推理轨迹,在四个数据集上对五个模型实现最高60%的相对准确率提升。
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
从噪声到多样性:在LLM推理中的随机嵌入注入
机构 * Gwangju Institute of Science and Technology(光州科学技术学院) ; Seoul National University(首尔国立大学) ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。
Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)
推理模型中的流体表示
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。
Comments EMNLP 2026
训练后转移置信度:对自训练微调、强化学习和在线策略蒸馏如何塑造思维链前、中、后校准的三阶段分析
机构 * Eastern Institute of Technology(东理工学院) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 数学推理 :CoT(title);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究大型语言模型训练后方法在推理中重塑置信度的情况,提出三阶段校准框架,发现不同方法在不同阶段的置信度特点,基于此提出位置感知置信策略PosConf,提升了强化学习答案聚合及在线策略蒸馏早期停止效果。
CRISP: 通过迭代自策略蒸馏实现压缩推理
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
AI总结 CRISP通过自蒸馏使模型更简洁推理,无需真实答案或预算,在数学和多步骤规划任务中实现显著的token减少和精度提升。
Riazi-8B:用于数学推理的乌尔都语大语言模型
机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) ; National University of Sciences and Technology (NUST)(国家科学与技术大学) ; Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) ; Mid Sweden University(中瑞典大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。
相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。
PragReST:用于语用语言理解的自我强化反事实推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 提出PragReST框架,通过自监督构建语用问答数据、生成反事实推理轨迹,结合监督微调和强化学习提升大语言模型的语用推理能力,在四个基准上显著优于基线模型。
Comments First two authors contributed equally. Code and models: https://github.com/jihyung803/PragReST
定理驱动的可执行本体用于可解释机器推理
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出TGEO框架,将推理建模为可执行状态转换过程,通过定理族识别、本体绑定、语义对象发现等步骤生成可解释推理图,实现可验证、可重放的AI推理。
可观察模式并非解释:潜在推理模型的因果几何分析
机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,信息学实验室) ; Université Paris-Saclay(巴黎-萨克雷大学) ; NAVER LABS Europe(NAVER欧洲实验室)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文通过对照实验和因果干预发现,潜在推理模型中的可观察模式(如BFS前沿)在控制组中也出现且不总是因果影响行为,提出潜在思维的使用是分级的,其因果效应集中在低秩方向,几何结构随行为影响增强而更有序。
DyCon: 通过演化难度建模的动态推理控制
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhongguancun Academy(中关村学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 提出DyCon框架,利用步骤级嵌入动态建模推理过程中的难度演化,无需训练即可控制推理深度,减少冗余步骤,提升效率且不损失准确性。
Comments Accepted at ICML 2026
几何潜在推理诱导LLM生成更短的文本
机构 * Idiap Research Institute(日内瓦研究所) ; EPFL(苏黎世联邦理工学院) ; BUT(布拉格技术大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出几何潜在推理(GLR)方法,通过轻量级过渡头在嵌入空间中预测迭代方向更新,近似离散推理轨迹,从而在不显式优化长度的情况下显著缩短LLM的生成步数。
超越两阶段训练:用于大语言模型推理的协作式SFT与RL
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 提出BRIDGE框架,通过选择性知识迁移使SFT辅助RL训练,在数学推理等任务上优于两阶段和单阶段混合方法。
Comments ICML 2026
超越测试时记忆:用于LLM推理的状态空间最优控制
机构 * vita-group(vita组)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
AI总结 提出测试时控制(TTC)层,通过有限时域LQR规划实现推理,作为适配器集成到预训练LLM中,在数学推理任务上提升高达27.8%的准确率。
Comments ICML 2026
LambdaPO: 一种用于推理语言模型的Lambda风格策略优化
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL
AI总结 针对GRPO因使用群体均值作为基线而丢失细粒度偏好信息的问题,提出LambdaPO方法,通过将优势估计分解为成对偏好结构并引入语义密度奖励,从群体轨迹中挖掘更细粒度的优化信号,提升推理性能。
Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission. Author list and submitter name redacted due to disputed authorship
挖掘还是合成?重新思考数学推理迭代对齐中的探索效率
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) ; Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) ; Huawei Multimodal Model Lab(华为多模态模型实验室) ; Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 针对数学推理任务中迭代DPO对齐时高N采样收益递减且引入噪声的问题,提出PACE框架,通过低预算探索与纠错合成偏好对,以约1/5计算量达到或超越高N基线性能。
AgentCoMa:一个混合常识与数学推理的现实场景组合基准
机构 * Imperial College London(帝国理工学院伦敦分校) ; RIKEN(日本研究机构) ; University of Sheffield(谢菲尔德大学) ; University College London(伦敦大学学院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL
AI总结 提出AgentCoMa基准,测试大语言模型在组合常识与数学推理任务上的性能,发现模型在单独步骤上准确率高但组合后平均下降近30%。
Comments ACL 2026
Agent-X:评估视觉中心智能体任务中的深度多模态推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; University of Central Florida(中央佛罗里达大学) ; University of Oxford(牛津大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL
AI总结 提出Agent-X基准,通过828个真实视觉任务和细粒度步骤评估框架,揭示当前模型在多步视觉推理中全链成功率低于50%的瓶颈。
Comments Accepted in International Conference of Learning Representations (ICLR 2026)
为什么智能体定理证明器有效:数学推理模型的统计可证明性理论
机构 * CyberAgent, Inc.(CyberAgent公司) ; National Institute of Informatics, Japan(日本信息机构)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 本文通过统计可证明性理论,将形式化证明搜索建模为有限视界可达性MDP,分析了智能体定理证明器中各组件对有限预算下证明成功率的影响,并给出了成功率差距的误差界。
Comments accepted at icml2026
ALIVE: 通过对抗学习和指导性语言评估唤醒LLM推理
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI
AI总结 提出ALIVE框架,通过对抗学习与指导性语言反馈替代标量奖励,使模型内化推理逻辑,在数学、代码和逻辑推理任务中提升准确率、跨域泛化与自我修正能力。
从感知到思考:解耦感知与推理提升视觉语言模型的训练
机构 * Amazon(亚马逊) ; University of Waterloo(滑铁卢大学) ; Vector Institute, Canada CIFAR AI Chair(向量研究所,加拿大CIFAR人工智能主席)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究通过解耦感知与推理,发现视觉任务性能受限于感知能力不足而非推理本身,通过分阶段训练提升模型的感知与推理能力,从而在多个视觉数学和感知任务中取得更优表现。
Comments 19 pages, 9 figures; Accepted to ICML 2026; Project Page: https://ucsc-vlaa.github.io/VLM-CapCurriculum/
分步评分奖励用于大语言模型推理
机构 * Peking University(北京大学) ; JD Explore Academy(京东探索学院) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG
AI总结 本文提出一种分步评分奖励方法,通过引入LLM判官对每个评分项进行归因,规范化每步评分,并结合优势估计器提高推理准确性和减少自我纠正循环。
Comments Code available at https://github.com/akarinmoe/SRaR
你的推理模型是否在隐式地知道何时停止思考?
机构 * Beihang University(北京航空航天大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文研究了大推理模型在复杂推理任务中停止思考的隐式能力,提出SAGE方法提升推理效率与准确性。