DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Technique Report
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Technique Report
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments EACL 2024 main conference paper. Camera-ready version
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
Comments EMNLP 2023
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments EMNLP 2023
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments ACL 2023 Findings
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL
Comments ACL 2023 Main Conference
机构 * Mila - Quebec AI Institute & Université de Montréal(魁北克AI研究所与蒙特利尔大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in Transactions on Machine Learning Research (TMLR), 2025. Code: https://github.com/twni2016/llm-reasoning-uft
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments v3.0. Control experiments, further AIW problem versions, testing recent reasoning models. Short version appeared at NeurIPS Scientific Methods for Understanding Deep Learning Workshop (SciDL) 2024, https://openreview.net/forum?id=Mkl7dzjYiW
棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力
机构 * NVIDIA Research(NVIDIA研究部) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。
何时学习停止有帮助?推理模型中早期退出的成本感知研究
机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) ; Stanford University(斯坦福大学) ; Independent Researcher(独立研究员)
专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。
Comments 23 pages, 5 figures
VeriEvol:通过可验证的进化指令扩展多模态数学推理
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯混元)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。
关于RL训练的语言模型的最优推理长度
机构 * University of Tokyo(东京大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。
Comments 18 pages, 12 figures
推理的几何:有效数学推理的谱特征
机构 * Valentin Noël(瓦伦丁·诺埃尔)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过将注意力矩阵视为加权词图,提取四个无需学习的谱诊断指标(Fiedler值、高频能量比、谱熵和平滑度),有效区分有效推理与模式匹配,在多个模型上达到85-96%的分类准确率。
Comments 30 pages, 13 figures, Accepted at ICML 2026 (main track)
反自我蒸馏用于通过点互信息的推理强化学习
机构 * Xiaohongshu Inc.(小红书公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。
通过群体回合策略优化增强多轮工具集成代理推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AWS AI Labs(AWS人工智能实验室) ; NVIDIA ; Meta
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。
更少的噪声,更多的声音:通过指令净化进行推理的强化学习
机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) ; Baidu Inc.(百度公司)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。
Comments Accepted at ACL 2026, camera-ready version
文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。
Comments CVPR Finding, 2026
SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理
机构 * Huawei Taylor Lab(华为泰勒实验室) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。
Comments ACL 2026 Main
批量上下文强化:一种任务扩展定律以实现高效推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出批量上下文强化方法,通过在共享上下文窗口中同时解决多个问题,实现高效推理,减少token消耗并提升准确性。
Comments 43 pages, 5 figures, 24 tables
高效平衡思考推理
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhongguancun Academy(中关村学院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。
Comments Accepted by ICLR 2026
思想多样性在多智能体辩论框架中增强了推理能力
机构 * University of Montreal(蒙特利尔大学) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过多智能体辩论框架发现,思想多样性显著提升LLM推理能力,中等规模模型在GSM-8K基准测试中超越GPT-4,达到91%准确率,同时在ASDiv基准测试中创下新纪录。
Comments 11 pages, 9 figures
Journal ref Journal of Robotics and Automation Research(JRAR), Vol. 5 Issue 3, October -2024, pg. 1-10
慢-快策略优化:在更新前重新定位用于大语言模型推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Manchester(曼彻斯特大学) ; NVIDIA ; Independent(独立) ; Emory University(埃默里大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。
Comments Published as a conference paper at ICLR 2026
LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Microsoft Research(微软研究院) ; University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学) ; CUHKSZ(香港中文大学(深圳)) ; THU(清华大学)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。
RM-R1: 作为推理的奖励建模
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; Texas A&M University(德克萨斯A&M大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RM-R1通过将奖励建模作为推理任务,提升模型的可解释性和性能,实验证明其在多个基准测试中表现优于现有模型。
Comments ICLR 2026
BARREL:面向事实性和可靠性的边界感知推理
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,清华大学数据科学与技术研究院) ; Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,高性能计算研究所,新加坡科技研究局) ; The College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BARREL通过促进简洁且边界感知的事实推理,提升了大型推理模型的事实可靠性,实验显示其在可靠性方面有显著提升,同时保持了与传统微调模型相当的准确性。
可扩展的大语言模型推理加速与低秩蒸馏
机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学) ; Meta FAIR at Meta(Meta FAIR) ; CMU(卡内基梅隆大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。
当领域互动时:强化学习中的非对称和顺序敏感的跨领域效应
机构 * Case Western Reserve University(凯斯西储大学) ; North Carolina State University(北卡罗来纳州立大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示GRPO在多领域训练中存在不对称性和顺序敏感性,指出训练顺序对推理性能有显著影响。
通过交互式解释界面提高LLM推理的人类验证
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出三种交互式推理界面,通过增强用户对LLM推理过程的理解,提高人类验证效率和准确性。
Comments 19 pages, 14 figures