How Powerful are LLMs in Generating Formal Program Specifications?
大型语言模型在生成形式化程序规约方面的能力有多强?
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
大型语言模型在生成形式化程序规约方面的能力有多强?
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。
GraphAlignCoder:对齐程序与证明图的代码生成框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。
Comments 9 pages, 3 figures
确定性跨域接口的自动合成
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。
CognixShield:基于LLM的、面向大型代码库的PoV引导式漏洞API使用检测
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 CognixShield是一款LLM驱动的框架,通过保留语义的AST碎片化、感知漏洞的多智能体RAG、PoV引导的语义推理三个核心组件,在57个Java应用上实现了优于现有工具的漏洞API使用检测性能。
Comments accepted in ESEM 2026
开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试
专题命中 代码与定理证明 :planning(abstract)
AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。
将大语言模型引入时间敏感网络的设计流程
专题命中 代码与定理证明 :planning(abstract)
AI总结 针对配置优化TSN网络的挑战,通过跨模型案例研究评估现有大语言模型能力,提出LLM辅助编排框架,介绍构建模块与管道,分析实际部署机会与局限,为评估LLM辅助TSN编排可行性提供路线图。
D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明
专题命中 代码与定理证明 :verifier(abstract)
AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。
CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。
关于《库罗夫卡笔记本》中的一些问题
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文解决《库罗夫卡笔记本》中八个群论问题,包括构建特定群、证明元素乘积取值情况、说明群阶与统计量不能确定单性、构造算子,还涉及确定生成群、证明幂图性质、探讨子群格情况及反驳秩不等式,且由形式推理主体在Lean中完成。
Comments 21 pages. Lean 4 formalisation: https://github.com/pitmonticone/Kourovka. v2: Expands the appendix with an account on problem selection and adds the MathOverflow provenance of Problem 18.50
FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。
针对顺序弱内存ISA的乱序多处理器形式验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。
用大语言模型绘制狭窄走廊
专题命中 代码与定理证明 :chain-of-thought(abstract)
AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。
给我看钱:一个关于证明驱动软件理解的实践
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究对成熟工业C++代码库进行证明驱动软件理解,结合大语言模型、PVS和SeaHorn,对恒星区块链SDEX订单簿核心算法形式化分析,发现文档不一致,生成便于检查代码更改的工件,展示了定理证明与模型检查组合为遗留系统提供保证的途径。
Comments CAV 2026
超越检测:智能合约的代理攻击合成与模拟
专题命中 代码与定理证明 :planning(abstract)
AI总结 研究智能合约漏洞利用验证问题,提出KASS多智能体框架,将自动利用生成分解为多阶段并集成多种机制,在多类智能合约上评估,能成功生成可执行利用及结构化攻击计划,验证效果优于其他工具。
正确性、置信度与上下文:在人工智能时代构建软件保障
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 探讨软件工程中正确性相关挑战,指出传统方法与生成式人工智能在软件保障上的差异,呼吁系统思考保障技术,做出明智选择。
Comments 12 pages, 10 figures, text for invited keynote at FSE 2026 in Montreal. Revised after the conference to reflect discussions at the conference
物理计数的计算复杂性
专题命中 代码与定理证明 :verifier(abstract)
AI总结 研究物理计数的计算复杂性,提出决策商 Q 作为最小抽象,并证明多个复杂性理论结果。
Comments Main PDF: 35 pages, 4 tables. Supplementary: 26 pages, 2 tables. Lean 4 release artifact available at https://doi.org/10.5281/zenodo.18140965
通过负测试作为完整性信号的强化学习用于形式规范综合
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。
WebDesignIter:用于仓库级前端代码生成的协同进化设计知识
专题命中 代码与定理证明 :planning(abstract)
AI总结 研究针对前端开发仓库级代码生成问题,提出WebDesignIter框架,通过持久知识图谱融合设计知识与仓库结构,分两阶段工作,实验证明其相比基线和通用编码代理有优势,凸显设计知识对仓库级代码生成的重要性。
混合群体中的集体认知:网络科学综合研究
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 研究人工智能代理融入人类团队后混合系统中集体智能的产生,综合网络科学等多学科,通过注意力等视角分析不同网络中集体结果的塑造因素及扩展到混合环境的情况,确定鲁棒效应与需修正之处,得出对相关方面的启示。
Comments Non-authoritative author's version of forthcoming chapter in the Springer Nature Handbook of Hybrid Intelligence
VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络
机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) ; Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。
多模态智能体中实现错误的综合研究
专题命中 代码与定理证明 :planning(abstract)
AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。
PBFuzz:面向漏洞证明的代理引导模糊测试
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 PBFuzz通过模拟人类专家流程,自动提取语义约束并高效生成漏洞证明输入,实验表明其在效率和漏洞触发性能上优于现有方法。
Comments 24 pages, 8 figures
基于参数安全证明的自适应防护
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。
Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025
面向分子模拟的量子纠错编码演化
专题命中 代码与定理证明 :verifier(abstract)
AI总结 利用LLM驱动的演化程序合成,发现分子模拟中距离5和6的广义超快编码,并进一步通过压缩导向搜索获得结构化循环构造器。
Comments 16 pages including appendices, 4 figures, 8 tables
CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准
专题命中 代码与定理证明 :verifier(abstract)
AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。
Comments 23 pages, 17 figures, FSE 2026
使用宽松自然形式语言的可验证数学自动形式化
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。
形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环
专题命中 代码与定理证明 :verifier(abstract)
AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。
统计证明作为人机协作的窗口:实践见解与社区议程
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 通过统计证明任务,发现当前通用大语言模型在精确定义问题下可执行技术组件,但在开放或长链推理中不可靠,提出人机协作中人类专业知识应聚焦于问题构建与验证。
SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。
从生产SIEM到可复用的网络安全工件
专题命中 代码与定理证明 :verifier(abstract)
AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。