Mathematics, word problems, common sense, and artificial intelligence
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
优化低成本部署强模型:面向进化优化的成本感知跨层迁移
机构 * IBM Research(IBM研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。
通过语言模型中几乎正交的特征实现孤立干预
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究基于机械可解释性前提,针对语言模型特征纠缠问题,受“独立因果机制”启发,提出将内部特征约束为几乎正交,通过形式化问题、界定干扰传播并关联正则化,实现对数学推理概念更孤立的干预且保留模型性能。
Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026
LLMs编码其失败:从预生成激活中预测成功
机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) ; FLAIR, University of Oxford(牛津大学FLAIR) ; Department of Computer Science, University College London(伦敦大学学院计算机科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过预生成激活预测LLM在数学和编程任务中的成功率,发现模型内部表示能有效指导更高效的推理,且在MATH任务中通过模型池路由可提升性能并降低70%的推理成本。
Comments Accepted at COLM 2026
基于变分学习的RLVR参数探索
机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) ; National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。
知-言差距:当探测模型发现错误而置信度未察觉时
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。
WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。
Comments COLM2026. Project Page: https://webchorearena.github.io/
自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。
Comments 13 pages, 3 figures
基于非对称强化学习与自蒸馏的指令条件探索
机构 * University of Southampton(南安普顿大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对LLM强化学习中的探索挑战,提出指令条件探索(ICE)方法,结合非对称RL/SD训练目标,使Qwen3-1.7B数学推理性能提升5.0%且长上下文下仍有效。
Comments Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa
基于渐进式经验演化的自我改进大语言模型
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出统一后训练框架SPEE,通过显式经验演化与隐式策略优化结合,在五种数学推理基准上提升了大语言模型的自我改进能力,优于现有基线方法。
Comments 10 pages, 5 figures
问题催生问题:面向竞赛数学强化微调的自演进课程
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。
自然语言数学证明的高性价比自动评判
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。
Comments 7 pages, 5 figures, 4 tables
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
机构 * Samsung AI Center(三星人工智能中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Mathematics debugged, added examples and illustrations, corrected claims, and re-edited, typos removed
通过对数偏差对语言模型进行极其简单的黑箱适应
机构 * Tel Aviv University(特拉维夫大学) ; Google Research(谷歌研究院) ; Columbia University(哥伦比亚大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。
Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation
相同问题,不同答案:超越准确率评估大语言模型的可靠性
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。
基于前缀重放的多轮在线策略蒸馏
机构 * Microsoft Research(微软研究院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。
基于轨迹的策略蒸馏用于掩码扩散语言模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。
使用大语言模型进行特征生成:一种进化算法方法
机构 * University of Luxembourg(卢森堡大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。
Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)
Mediator:基于较少参数冲突和不确定性路由的内存高效大语言模型合并
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型合并中参数冲突致性能下降等问题,提出基于层参数冲突情况分别处理,结合任务算术稀疏性解耦专家,依输入数据任务不确定性选合并专家,实验表明该方法提升性能且降低系统成本。
Comments work in progress. arXiv admin note: text overlap with arXiv:2405.09673 by other authors
用于扩散语言模型的掩码感知策略梯度
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。
Comments Accepted at COLM 2026
作为无标签自蒸馏特权上下文的共识
机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学) ; ILCC, University of Edinburgh(信息实验室,爱丁堡大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究旨在提高无标签大语言模型推理准确性,提出CANON方法将共识转化为token级监督,通过采样多个解决方案并以达到多数答案的方案为条件设置模型快照来监督。实验表明该方法大幅提升性能,还能迁移,改进非单纯分布锐化。
Autodata: 一种创建高质量合成数据的智能数据科学家方法
机构 * Meta
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。
基于近似查询处理和代理模型的AI工作流查询中心优化
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract)
AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。
Logit贡献评分识别非字面检索头
机构 * University of Edinburgh(爱丁堡大学) ; Heriot-Watt University(赫瑞瓦特大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Logit贡献评分(LOCOS),通过OV电路输出投影到答案标记方向,识别大语言模型中执行非字面检索的注意力头,消融实验显著降低ROUGE-L而保持其他能力。
Comments 41 pages, 18 figures
从搜索到合成:训练大语言模型为零样本工作流生成器
机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。
Comments 35 pages, 8 figures
通过平滑MMD对齐增强LLM中的数值预测
机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。
通过融合路由实现令牌级LLM协作
机构 * [cs.AI](计算机科学与人工智能)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。
Comments 25 pages