Mathematical certification of motion planning on uncertain terrain with limited perception: a case study
专题命中 数学推理 :planning(title)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :planning(title)
StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。
Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026
数学视觉图表:评估大型语言模型数学图表生成能力的综合基准
机构 * Pandita AI Inc.(潘迪塔人工智能公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG
AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。
Comments Accepted at ICANN 2026
ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。
Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
何时投票,何时重写:基于分歧的策略路由用于测试时扩展
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) ; Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(哈工大深圳))
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出基于输出分歧的策略路由方法,通过动态选择不同扩展策略提升数学推理任务的准确性,减少计算成本。
给自己的笔记:大语言模型能从经验抽象中受益吗?
机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。
验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。
Comments 18 pages, 10 figures, 10 tables. Under review
AIMO可解释性挑战
机构 * National Institute of Informatics(日本国立信息学研究所) ; Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) ; University of Tübingen(图宾根大学) ; Fuzhou University(福州大学) ; Masaryk University(马萨里克大学) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。
Comments Accepted Competition at NeurIPS 2026
OptiAgent:基于多智能体迭代精化的端到端优化建模
机构 * Instituto de Ciência e Tecnologia do Itaú(伊塔乌科技学院)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 针对运筹学问题自然语言描述转可求解数学形式与可执行代码的需求,OptiAgent采用多智能体迭代自校正与多回路验证架构,在多数优化任务基准上取得SOTA性能,建模过程可审计。
QED:一个用于生成开放问题数学证明的开源多智能体系统
专题命中 数学推理 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出开源多智能体系统QED,通过分解规划、生成论证和验证正确性的流水线,自动将研究问题转化为完整数学证明,并在18个研究级项目中成功生成5篇原创工作。
Adam的定律:大型语言模型中的文本频率定律
机构 * FaceMind Corporation(FaceMind公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL
AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。
Comments ACL 2026 Main Conference; The latest version
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型
机构 * SenseTime(商汤科技) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。
并行测试时扩展与多序列验证器
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出多序列验证器(MSV),通过条件化候选集预测正确性,改善校准性,提升最佳选择准确率并实现早停策略,在数学推理任务中以不到一半延迟达到相同精度。
逃离认知陷阱:使用现成模型高效解决竞赛数学问题
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG
AI总结 提出一种推理流水线,利用现成模型以极低成本在IMO风格数学问题上达到最佳性能,通过猜想提取和上下文分离解决求解器-评分器流水线中的认知陷阱问题。
跨模型分歧作为无标签正确性信号
机构 * Independent Researcher(独立研究者) ; Department of Computer Science Columbia University(计算机科学系哥伦比亚大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出跨模型分歧作为无标签正确性指标,通过验证模型对生成模型答案的困惑度或熵来检测错误,无需训练或标签,在多个基准上优于模型内不确定性方法。
多智能体协作的反事实信用策略优化
机构 * Beihang University(北航) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。
Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能
机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) ; Peking University(北京大学) ; Zhejiang University(浙江大学) ; Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。
Comments Work in Progress. May version add more experiments
T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; School of Mathematical Sciences(数学科学学院) ; Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL
AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。
GIFT:游戏作为通用型LLM的非正式训练
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。
GTBench:一个基于课程体系的基准,用于评估大语言模型作为图论数学研究助手的能力
机构 * Louisiana State University(路易斯安那州立大学) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Texas A&M-Central Texas(德克萨斯大学阿姆斯特朗中央分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出GTBench基准,通过三个难度递增的图论问题组(本科定义、算法推理、研究生证明)评估大语言模型的数学推理能力,发现GPT-5表现最佳,其他模型随难度下降显著,并揭示了人类与自动评估者之间的系统性分歧。
Comments 19 pages, 5 figures, 7 tables
基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。
Comments 11 pages, 3 figures, 5 tables
CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转
机构 * School of Software and Microelectronics, Peking University, Beijing(北京大学软件与微电子学院) ; School of Artificial Intelligence, Peking University, Beijing(北京大学人工智能学院) ; School of Computer Science, Peking University, Beijing(北京大学计算机科学学院) ; School of Future Technology, Peking University, Beijing(北京大学未来技术学院)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出CAST方法,通过无答案的自教师模型和双向局部优势符号翻转,解决GRPO中奖励稀疏和组相对优势消失的问题,提升数学推理性能。
Comments 10 pages
RADAR:面向多智能体通信结构生成的冗余感知扩散方法
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。
Comments Accepted by ICML 2026 (fix typos)
超越数学与代码的可验证奖励:面向事实问答的轻量级语料库基础过程监督
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 提出CorVer,一种基于语料库共现统计的轻量级过程奖励方法,通过句子级信用分配和令牌级优势映射,在多个模型和基准上显著提升事实问答准确性且训练速度更快。
ResearchMath-14K: 通过智能体扩展研究级数学
机构 * Seoul National University(首尔国立大学) ; OneLineAI ; Yonsei University(延世大学)
专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL
AI总结 本文通过多智能体流程从学术来源构建了最大的研究级数学问题数据集ResearchMath-14K(14,056个问题),并生成220K教师轨迹,经智能体过滤后微调Qwen3模型(4B-30B)平均提升9.2个点,表明过滤后的开放问题尝试即使没有完全正确的推理轨迹也能提供有效监督。
Comments Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k
LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证
机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) ; Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。
VineLM: 基于Trie的细粒度控制用于智能体工作流
机构 * Columbia University(哥伦比亚大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。
通过技能程序 harnessing LLM agents
机构 * New York University(纽约大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。
Comments 40 pages, 7 figures
一层解释所有:理解大语言模型中大规模激活现象
机构 * Rutgers University(罗格斯大学) ; Wake Forest University(威克森林大学) ; Meta AI
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL
AI总结 研究大语言模型中大规模激活的起源,发现ME层是大规模激活首次出现的层,并提出方法减少大规模激活的刚性,提升模型性能。