Self-Improving AI Agents through Self-Play
通过自play实现自我改进的AI代理
专题命中 代码与定理证明 :verifier(abstract);self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过自play实现自我改进的AI代理
专题命中 代码与定理证明 :verifier(abstract);self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Code: https://github.com/DelosLiang/masse
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Experimental verification and more formal argument for Markov approximation of bias propagation to be released soon. Primarily pushed now to establish novelty and ease of sharing. Please do not cite this work until the forthcoming experimental validation and updated mathematical model are provided
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
Comments To appear in Proc. 23rd Int. Conf. on Formal Methods in Computer-Aided Design (FMCAD)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
Comments Accepted in ICML 2023
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
Journal ref in IEEE Transactions on Neural Networks, vol. 18, no. 5, pp. 1463-1471, Sept. 2007
物理推理公理:在Lean中编码塞伯格 - 维滕解
专题命中 代码与定理证明 :reasoning(title)
AI总结 研究利用交互式定理证明器验证物理论证,通过假定物理假设清单,经机器可验证证明得出结果,以Lean 4形式化${N}=2$ $SU(2)$超杨 - 米尔斯的塞伯格 - 维滕解,为验证理论物理中AI生成结果提供合理标准。
Comments 18 pages; companion github repo mrdouglasny/seiberg-witten
PROMISE:证明自动化作为人类推理的结构模仿
专题命中 代码与定理证明 :reasoning(title)
AI总结 PROMISE通过结构化嵌入框架实现证明生成自动化,通过挖掘证明状态的结构模式提升大规模定理证明的可扩展性。
专题命中 代码与定理证明 :reasoning(title)
Comments 12 pages, 2 figures. Revised version based on referee reports
Journal ref Proceedings of FSTTCS05, LNCS vol. 3821, 0544c, 2005
缩小生成-验证差距的弱验证器
机构 * Stanford University(斯坦福大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Together AI
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 Weaver通过结合多个弱验证器,有效缩小生成-验证差距,提升验证性能至接近理想验证器水平。
Comments Annual Conference on Neural Information Processing Systems (NeurIPS) 2025
多智能体证明自动形式化的高效测试时优化
机构 * Polixir Technologies(波利希瑞技术公司) ; University of Science and Technology of China(中国科学技术大学)
专题命中 代码与定理证明 :reasoning(abstract);test-time compute(abstract);分类 cs.AI
AI总结 研究多智能体证明自动形式化,提出ToMap框架,将其构建为分解器-形式化器-证明器管道,经瓶颈分析聚焦于分解器优化,通过特定循环和标准指导更新,实验显示该方法提升了性能且降低测试成本。
形式化迪斯科:可扩展的形式化验证程序的开放式生成
机构 * Kempner Institute, Harvard University(坎普纳研究所,哈佛大学) ; School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学)
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对生成程序质量保证落后及形式验证数据稀缺问题,提出Formal Disco分布式系统,协调三类工人,记录痕迹用于改进,提出最大熵原则,发布数据集并微调模型,为形式推理领域大规模创建合成数据。
Comments Code: https://github.com/metareflection/formal-disco Datasets: https://huggingface.co/collections/metareflection/formal-disco
MINIF2F-DAFNY: 通过自动主动验证的LLM引导数学定理证明
机构 * University of Cambridge, Cambridge, UK(剑桥大学) ; Amazon Web Services, London, UK(亚马逊网络服务(伦敦)) ; Amazon Web Services, Boston, USA(亚马逊网络服务(波士顿))
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 提出首个将数学基准miniF2F翻译到自动主动验证器Dafny的数据集,评估8个LLM的证明生成能力,最佳模型Claude Opus 4.6达到62.7%的累积通过率,比空证明基线提升23.8个百分点。
超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述
机构 * IBM
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。
Comments 14 Pages, 1 Table, 1 Figure
AXE:针对局部漏洞报告的灰盒可利用性确认
机构 * Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出多智能体框架AXE,利用CWE分类和代码位置等轻量级元数据,通过解耦规划、代码探索和动态执行反馈实现Web漏洞利用,在CVE-Bench上达到30%成功率,比黑盒基线提升3倍。
基于Lean的过程验证强化学习用于定理证明
机构 * KAIST AI(韩国科学技术院人工智能系)
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出利用Lean证明助手提供过程级验证信号,结合GRPO风格强化学习目标,通过策略级监督提升定理证明性能。
Diffusion-Proof:超越自回归生成的正式定理证明配方
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达)
专题命中 代码与定理证明 :reasoning(abstract);math reasoning(abstract);分类 cs.LG
AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。
无意外软件智能体:首个用于人类代码熵降低的正则代码,以及30到500倍的前沿模型需求降低
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出智能体优先的正则代码方法,通过行为等价商化人类代码中的意外熵,实现30-500倍的前沿模型需求降低,核心是行为等价商化和证明携带变更。
Comments 36 pages
多智能体系统中信念修正公设的研究(扩展版)
机构 * University of New South Wales(新南威尔士大学) ; New Mexico State University(新墨西哥州立大学)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究认知规划中的信念修正问题,将经典AGM信念修正公设推广到多智能体环境,提出广义全交多智能体信念修正算子,并讨论迭代修正公设的推广及事件模型修正算子。
Causal-JEPA:通过对象级潜在掩码学习世界模型
机构 * Brown University, GalilAI(布朗大学,GalilAI) ; New York University(纽约大学)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出C-JEPA,一种通过对象级潜在掩码扩展联合嵌入预测的对象中心世界模型,在视觉问答和智能体控制任务中分别提升反事实推理20%和仅用1%潜在特征实现高效规划。
Comments Project Page: https://hazel-heejeong-nam.github.io/cjepa/ ICML 2026 Accepted
Text2Model: 用于文本到模型翻译的建模副驾驶
机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出Text2Model和Text2Zinc,通过统一架构和数据集、求解器无关的方式,利用多种LLM策略实现文本到组合优化与满足问题的模型翻译,并开源副驾驶和排行榜以缩小性能差距。
Comments AAAI'25 Bridge Program on Machine Learning and Operations Research CPAIOR'26 Master Class on LLMs for CP/OR
SpecAlign: 一种用于 SystemVerilog 断言生成的语义对齐框架
机构 * University of South Florida(佛罗里达州立大学)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出 SpecAlign 框架,通过基于蕴含的分类和自一致性投票机制,评估并改进 LLM 生成的 SVA 与自然语言规范之间的语义对齐,无需黄金 RTL。
BODHI:精确的操作系统内核规范推断
机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Johns Hopkins University(约翰霍普金斯大学) ; Department of Computer Science(计算机科学系)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出一种领域知识提示方法BODHI,通过结构化C到Python翻译指南增强少样本提示,在OSV-Bench基准上将Pass@1从55.10%提升至96.73%,缩小了通用代码生成与形式规范合成之间的差距。
TRUST:一种去中心化AI服务框架v.0.1
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。
利用LLM进行早期阶段产品线验证:对半正式蓝图分析的研究
机构 * Graz University of Technology(格拉茨技术大学)
专题命中 代码与定理证明 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 研究LLM能否直接对半正式文本蓝图执行特征模型分析操作,通过12种先进LLM和16种标准操作,对比其与求解器FLAMA的输出,发现优化推理模型在准确性上接近求解器,揭示了结构解析和约束推理的系统性错误及精度-成本权衡。
Comments The 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), March 23--27, 2026, Thessaloniki, Greece DOI: 10.1145/3748522.3779903
心理学习范式如何塑造和制约人工智能
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。
Comments preprint journal
通过有限半群迭代和李代数近似进行本体轨迹预测:在地缘政治知识图谱中的应用
机构 * Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业及系统工程学系)
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 本文提出EL-DRUIN系统,结合形式本体、有限半群代数和李代数近似,预测地缘政治长期关系轨迹,通过半群操作和李代数空间向量嵌入实现可解释的概率预测。
Comments 18 pages. Code and system available at https://github.com/wuqihang-brave/El-druin
VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成
机构 * University of California, Irvine(加利福尼亚大学尔湾分校)
专题命中 代码与定理证明 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。
ARYA:一种受物理约束的可组合且确定性世界模型架构
机构 * ARYA Labs(ARYA实验室)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。