SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)
Comments version 1.0
专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2024 camera-ready
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project webpage: https://agent-force.github.io/unified-alignment-for-agents.html
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)
专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments Accepted to the Proceedings of the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025)
专题命中 代码与定理证明 :reasoning(abstract,journal_ref);分类 cs.AI、cs.LG
Journal ref In Thomas Eiter and David Sands, editors, 21st International Conference on Logic for Programming, Artificial Intelligence and Reasoning (LPAR-21). EPiC Series in Computing, vol. 46, pages 85-105, EasyChair, 2017. ISSN 2398-7340
再见,蓝皮书?用AI辅助规则遵循实现法律苦差事自动化
机构 * Yale Law School(耶鲁法学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对法律AI在《蓝皮书》引文格式任务的表现,构建了新基准,提出神经符号系统方法使准确率提升32.4个百分点至最高85.5%,指出AI与符号规则引擎结合是可行方向。
TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准
专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具
基于LLM符号化结构化过程的可解释无监督社区检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of New South Wales(新南威尔士大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出LLM引导的无监督社区检测方法LUCID,通过四阶段流程结合LLM生成规则实现可解释性,在真实数据集上性能优于主流无监督与半监督基线。
网络系统的不变量发现
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究网络系统不变量发现问题,核心方法是将其分为人工智能驱动的语法“发现”与统计驱动的“搜索”问题,设计实现Autogram系统,贡献是能在多种数据上高覆盖率、低误报地恢复专家不变量并讨论开放问题。
Comments 8 pages, 4 figures, 1 table
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
LeanFlow:工作流驱动的精益自动形式化案例研究
机构 * Moonshot AI(月球计划人工智能公司) ; epfl-lara(洛桑联邦理工学院拉腊实验室)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究通过对两篇数学论文案例研究,探讨文档到项目形式化中运行时机制对相关指标的影响,使用Kimi2.6和GPT5.5进行消融实验,报告多项数据,展示LeanFlow在特定任务上的表现及校准成果。
Comments 14 pages, 3 figures, ICML 2026: AI for Math Workshop
ETAS:一种用于智能体系统的效果类型化语言
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。
迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。
在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现
机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) ; Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。
Journal ref Neurobiology of Language 2026
从求解器到研究:前沿研究中的大语言模型驱动形式数学
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 探讨AI4Math领域进展,指出当前系统处理前沿数学问题有局限。主张从预定义求解器转向研究代理,对该领域进行系统综述,识别现有系统局限性,为AI4Math未来发展规划战略路线图。
用于商业保险承保的具有对抗性自我批评的智能体人工智能
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。
Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)
Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)
单子上下文工程
机构 * IIIS, Tsinghua University(清华大学人工智能研究院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Monadic Context Engineering,利用函子、应用函子和单子的代数结构,为智能体设计提供形式基础,通过分层方法构建高效可靠的AI智能体。
Comments We found some issues in the categorical foundations of this work, so we respectfully withdraw it
一个量子优化猜想的机器验证证明
机构 * Center of Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学中心) ; MIT Center for Theoretical Physics - a Leinweber Institute(麻省理工学院理论物理中心 - 莱因韦伯研究所) ; Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 利用大语言模型Claude Fable 5发现证明,并通过Lean 4证明助手端到端验证了Farhi-Goldstone-Gutmann猜想,即深度p的量子近似优化算法在环上的近似比恰好为(2p+1)/(2p+2)。
统计不可区分,操作上截然不同:表格基础模型的形式化障碍
机构 * SAP SE(SAP公司)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出操作图灵测试,证明仅基于值的表格模型无法区分合法与违规数据库状态,而操作审计特征可突破该障碍,揭示可识别性而非模型容量是根本限制。
Comments Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data, 2026
形式化公理系统中的自监督定理发现
机构 * The University of Tokyo, Japan(东京大学,日本) ; RIKEN AIP, Japan(日本RIKEN AIP)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。
Comments AI for Math Workshop @ ICML 2026
计划不会持久:为什么上下文管理对LLM代理至关重要
机构 * Snowflake AI Research(Snowflake AI研究)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。
Comments 17 pages, 8 figures
VeriBound: 使用形式验证工具训练的过程奖励模型的PAC-Bayesian泛化界
机构 * University of Malaya(马来亚大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对形式验证工具标注的过程奖励模型(PRM)缺乏理论解释的问题,提出VeriBound框架,给出PAC-Bayesian泛化界、样本复杂度、收敛速率及下游Best-of-K性能的误差传播界。
假设约束的多智能体自动形式化渐近统计理论
机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) ; Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系) ; Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院生物统计系)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出一种假设约束的多智能体Lean 4形式化流程,通过七个专业角色协调工作,实现渐近统计理论中参数和半参数模型的形式化,确保公理干净且忠实于原文。
中国司法判决中法律论证结构的标注与可视化指南
机构 * Law School, Nanjing University(南京大学法学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出一个系统化、可操作的标注框架,用于表示司法判决中的法律论证结构,支持大规模司法推理分析和法律论证挖掘。
Comments This Guideline has been developed through revision and refinement based on the first edition. The element label system has been adjusted, and the annotation granularity and annotation workflow have been further optimized
CAF-Gen: 一种用于丰富论证结构的多智能体系统
机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。
Comments Accepted for publication in the proceedings of ICCCI 2026