Statistical Early Stopping for Reasoning Models
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
熵梯度反转:迈向大型推理模型的内部机制
机构 * National University of Singapore(新加坡国立大学) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。
Comments 15 pages, 5 figures, 8 tables
小型模型是GRPO中策略级多样性的自然探索者
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。
数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现
机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。
规划锤击:面向自动化Rocq证明的难度感知分解
专题命中 代码与定理证明 :planning(title,abstract)
AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。
Comments 26 pages, 8 figures; submitted to OOPSLA 2026
用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。
AREX:迈向深度研究的递归自我改进智能体
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。
突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究
机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) ; Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) ; Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。
分析八个大语言模型的伦理逻辑
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。
从心智到机器:Manus AI作为完全自主数字代理的崛起
机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) ; Department of Computer Science, Brown University(布朗大学计算机科学系) ; Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。
SURE-RAG:用于选择性检索增强生成的充分性和不确定性感知证据验证
专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 研究选择性检索增强生成的证据充分性验证问题,提出SURE-RAG聚合协议,通过共享验证器生成局部关系分布并聚合为特征块,产生三向决策和可审计分数,实验表明其性能优于多种方法,还对比了与GPT-4o在不同任务上的表现。
Comments 8 pages, 2 figures, 8 tables. Submitted to IEEE PRAI 2026
大语言模型中置信度的计算基础
机构 * Google DeepMind(谷歌DeepMind) ; École Polytechnique(巴黎综合理工学院) ; Princeton University(普林斯顿大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。
InteractComp:使用模糊查询评估搜索代理
机构 * DeepWisdom(深智科技) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Renmin University of China(中国人民大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Agent Universe(智能体宇宙) ; McGill University(麦吉尔大学) ; Yale University(耶鲁大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures
当伦理与收益相悖时:道德两难情境下的大语言模型智能体
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。
行政法的第四次 settlements:人工智能与能力-问责陷阱
机构 * University of Oxford(牛津大学) ; Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨行政法在人工智能时代如何摆脱能力与问责之间的困境,提出通过建立可审计的AI系统框架,提升政府透明度与问责机制。
Comments 87 pages
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。
基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习
机构 * Terminus Group(Terminus集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对过程强化学习中引入奖励模型计算开销大且缺乏统一优势估计框架的问题,提出SPRO框架,通过从策略模型导出奖励及重新定义优势进行过程感知强化学习,实验显示其训练效率高、准确率提升且无额外开销。
MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kyoto University(京都大学) ; Tsinghua University(清华大学) ; East China Normal University(华东师范大学) ; Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) ; GenBio AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。
Comments Accepted by Npj Digital Medicine
通过错误定位进行测试时缩放
机构 * Google DeepMind(谷歌DeepMind)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。
Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)
学习进行事实性推理
机构 * FAIR at Meta(Meta 的 FAIR) ; University of Washington(华盛顿大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。
Comments ICML 2026
超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型
机构 * Inha University(延世大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。
TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。
DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究金融决策中智能体行为稳定性,引入DFAH-Bench基准,通过多渠道衡量。发现仅结果一致性不能完全反映稳定性,前沿模型存在决策与工具路径一致性差距,识别出三种行为模式,并开源相关代码和数据。
Comments 15 pages, 3 figures. Code, sanitized replay logs, one-command reproduction (make reproduce-paper), and an interactive results explorer: https://github.com/ibm-client-engineering/output-drift-financial-llms
AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架
机构 * The University of Melbourne(墨尔本大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。
享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判
机构 * SenseTime Research(商汤科技研究院) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。
超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?
机构 * ByteDance Inc.(字节跳动公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。
Re-FORC:用于高效思维链推理的自适应奖励预测
机构 * AWS Agentic AI(AWS智能代理部门) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG
AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。
Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
Gemma 4技术报告
机构 * Google DeepMind(谷歌DeepMind)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。
Comments 17 pages, 2 figures, technical report, updated