Statistical Early Stopping for Reasoning Models
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
熵梯度反转:迈向大型推理模型的内部机制
机构 * National University of Singapore(新加坡国立大学) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。
Comments 15 pages, 5 figures, 8 tables
小型模型是GRPO中策略级多样性的自然探索者
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。
数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现
机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。
用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。
规划锤击:面向自动化Rocq证明的难度感知分解
专题命中 代码与定理证明 :planning(title,abstract)
AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。
Comments 26 pages, 8 figures; submitted to OOPSLA 2026
使用GPT-5.5 Pro对实数上的和积猜想进行自主反证
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文借助GPT-5.5 Pro构建智能体,通过三阶段提示管道,对实数上的和积猜想进行自主反证,8次试验中7次成功生成正确证明,每次试验平均用132.4k推理令牌,还发布相关内容供重现研究。
用于大语言模型逻辑推理的符号逻辑六边形理论
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。
用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。
SCALE:用于先进节点局部布局与布线设计规则违规修复的自监督约束感知布局生成
机构 * NVIDIA(英伟达) ; Duke University(杜克大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 针对先进节点局部P&R DRV修复难题,提出SCALE框架,通过自监督布局生成、利用自然语言规则约束和高温采样等方法,生成DRC注释布局违规对微调DRC-VLM,有效提升了最先进代理的修复解决率。
Comments 8 pages, 5 Figures, 6 Tables
AREX:迈向深度研究的递归自我改进智能体
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。
突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究
机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) ; Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) ; Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。
分析八个大语言模型的伦理逻辑
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。
EVL-MCoT:用于有害模因检测的增强视觉语言多思维链
机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)
专题命中 规划推理 :CoT(title,summary_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。
一种用于无训练城市医疗保健 OD 预测的知识驱动行为推理框架
专题命中 规划推理 :reasoning(title,abstract);planning(abstract)
AI总结 研究城市医疗保健 OD 预测问题,提出基于知识驱动行为推理的无训练框架,将异构城市信息组织成知识图谱,通过多智能体推理实现预测。实验表明该框架性能优于传统深度学习基线,凸显城市智能在医疗保健出行建模上从数据拟合到知识驱动推理的潜力。
Comments 16 pages, 9 figures. Submitted to the 4th International Conference on Urban Science and Intelligence
学习时空决策先验以实现部分可观测性下的高效路径规划
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) ; School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学) ; Department of Information Technology, Old Dominion University(信息技术系,老 Dominion 大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 研究部分可观测性下的路径规划问题,提出ImiPath框架,从示范轨迹提炼时空决策先验,经局部时空观测表示和时空注意力策略网络转换为决策先验并纳入异构规划器,提升路径质量与搜索效率,验证了框架的适应性和实际部署潜力。
基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试
机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea ; organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA
专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。
从孤立任务到结构化能力:大语言模型的多层分类法
机构 * Fudan University(复旦大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。
Comments 34 pages, 5 figures, 20 tables
从心智到机器:Manus AI作为完全自主数字代理的崛起
机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) ; Department of Computer Science, Brown University(布朗大学计算机科学系) ; Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。
SoundscapeAgent:用于可控合成和可扩展音频-语言监督的智能音景构建
机构 * Tencent(腾讯)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 提出智能音景构建框架SoundscapeAgent,基于大语言模型的智能体将用户意图转化为场景计划,经多步骤实现可控音频合成与可扩展音频-语言数据构建,在生成性能及下游音频推理方面表现出色。
Comments Submitted to SLT 2026
通过物理智能解决通用机器人中的编排差距
机构 * Princeton University(普林斯顿大学) ; Together AI(联合人工智能)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。
SURE-RAG:用于选择性检索增强生成的充分性和不确定性感知证据验证
专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 研究选择性检索增强生成的证据充分性验证问题,提出SURE-RAG聚合协议,通过共享验证器生成局部关系分布并聚合为特征块,产生三向决策和可审计分数,实验表明其性能优于多种方法,还对比了与GPT-4o在不同任务上的表现。
Comments 8 pages, 2 figures, 8 tables. Submitted to IEEE PRAI 2026
硬决策层:Transformer中确定推理的证据
机构 * University of Southern California(南加州大学) ; Information Sciences Institute(信息科学研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究基于Transformer的语言模型在多选型问答中做预测的位置与方式,识别出硬决策层,经多模型和数据集验证其在无学习路由策略时一致出现且对微调不变,HDL处准确率显著提升,为Transformer推理提供见解与机会。
大语言模型中置信度的计算基础
机构 * Google DeepMind(谷歌DeepMind) ; École Polytechnique(巴黎综合理工学院) ; Princeton University(普林斯顿大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。
InteractComp:使用模糊查询评估搜索代理
机构 * DeepWisdom(深智科技) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Renmin University of China(中国人民大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Agent Universe(智能体宇宙) ; McGill University(麦吉尔大学) ; Yale University(耶鲁大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures
当伦理与收益相悖时:道德两难情境下的大语言模型智能体
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。
一种用于自主边缘资源分配的自校准智能体人工智能框架
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大语言模型驱动系统运行可靠性受挑战的问题,提出自校准智能体人工智能框架,设计自校准机制,应用于边缘计算网络零知识工作负载资源分析,提高预测准确率和速度,为自主人工智能部署奠定基础,且生成基本事实速度更快。
Comments This work has been submitted to the IEEE Transactions on Network and Service Management for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
ToolGuardian:人工智能代理与工具交互的声明式安全
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。
用于智能工作流合成的拓扑与执行耦合分层搜索
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国NEC实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。