Teaching Algorithmic Reasoning via In-context Learning
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2022
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments The paper has been accepted to the ACL-IJCNLP 2021 conference
ProgramTab:通过编程范式提升大语言模型的表格推理能力
机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) ; Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。
Comments Large Language Models, Table Reasoning, In-context Learning
学习如何使用工具,而非仅仅何时:基于模式的工具集成推理
机构 * University of Georgia(佐治亚大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。
Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025
通过混合训练缓解数学推理微调中的灾难性遗忘
机构 * Department of Computer Science(计算机科学系) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。
Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning
机构 * MIT(麻省理工学院) ; Comenius University in Bratislava(布拉迪斯拉发孔院大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted to The 5th Workshop on Mathematical Reasoning and AI at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025); 25 pages, 14 figures, 8 tables; Code available at https://github.com/NaiveNeuron/FractalBench
机构 * UC San Diego(加州大学圣地亚哥分校) ; Capital One(Capital One公司)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2025 Workshop on Efficient Reasoning
机构 * IBM Research – Zurich(IBM瑞士研究中心) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted at the 5th Workshop on Mathematical Reasoning and AI (MATH-AI), NeurIPS 2025
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; KRAFTON(KRAFTON公司) ; UC Berkeley(伯克利大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; School of Artificial Intelligence Chinese Academy of Sciences(中国科学院人工智能学院) ; Microsoft(微软) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments Reinforcement Learning; Large Language Models; LLM Reasoning
是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。
HoT: 用于从输入中引用支持事实的高亮推理链
机构 * Auburn University(亚伯拉罕大学) ; University of Alberta(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。
Formula-One Prompting:一种可组合的方程优先前缀用于应用数学
机构 * SCB DataX, SCBX Group(SCB数据X,SCBX集团)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出公式提示(FP)和Formula-One提示(F-1),通过先形式化问题中的控制方程再求解,在多个应用数学基准上优于思维链和程序思维提示,平均提升5.76和8.42个百分点。
大型语言模型在语义保持变异下的理解鲁棒性如何?
机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)
专题命中 数学推理 :reasoning(summary_cn,abstract);分类 cs.AI
AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。
Comments 17 pages, 5 tables, 1 figure
令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) ; Baidu Inc.(百度公司) ; Tsinghua University(清华大学) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。
机构 * PhysicsWallah(物理墙)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments Published at ICLR 2024
SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。
Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。
Comments 14 pages, 2 figures, 7 tables. Preprint
Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。
校准大语言模型推理的置信度边际过程监督
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。
并非所有转折都同样困难:为高效多轮推理的自适应思维预算
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。
多目标进化融合实现高效推理模型
机构 * Sapienza University of Rome(罗马大学) ; Independent Researcher(独立研究员) ; EPFL(瑞士联邦理工学院洛桑) ; NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。
Comments Published as a conference paper at COLM 2026
面向大语言模型推理的强化学习的期望最大化视角
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出EM策略梯度(EMPG)框架,将大语言模型推理的强化学习转化为期望最大化问题,在简化优化流程的同时,在GSM8K、MATH Hard数据集上取得与GRPO相当或更优的性能,且能生成更简洁的结构化推理轨迹。
Comments 20 pages
啄木鸟蒸馏:弱模型诊断强模型中的推理错误
机构 * Baidu Inc.(百度公司) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。
关于生成推理中大语言模型层剪枝的极限
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。
面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵
机构 * Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。
ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。
探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。
Comments Second Workshop on XAI4Science, AAAI 2026