arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1124 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1124 篇

2608.13077 2026-08-14 cs.SE 新提交 50%

How Powerful are LLMs in Generating Formal Program Specifications?

大型语言模型在生成形式化程序规约方面的能力有多强?

Fanpeng Yang, Xing Li, Shuling Wang, Jie An, Zeyu Sun, Shenghua Feng, Wenhan Wang, Weiyi Wang, Naijun Zhan, Fanjiang Xu

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11394 2026-08-13 cs.SE 新提交 50%

GraphAlignCoder: Aligning Program and Proof Graphs for Code Generation

GraphAlignCoder:对齐程序与证明图的代码生成框架

Yueke Zhang, Zihan Fang, Kevin Leach, Yu Huang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09312 2026-08-11 cs.NI 新提交 50%

Automated Synthesis of Deterministic Cross-Domain Interfaces

确定性跨域接口的自动合成

Konstantinos Christodoulopoulos, Antonis Selentis-Boulntadakis

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17798 2026-08-11 cs.SE cs.CR 版本更新 50%

CognixShield: PoV-Guided Vulnerable API Usage Detection in Large Codebases via LLMs

CognixShield:基于LLM的、面向大型代码库的PoV引导式漏洞API使用检测

Quanzhi Fu, Wang Lingxiang, Wenjia Song, Gelei Deng, Yi Liu, Dan Williams, Ying Zhang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CognixShield是一款LLM驱动的框架,通过保留语义的AST碎片化、感知漏洞的多智能体RAG、PoV引导的语义推理三个核心组件,在57个Java应用上实现了优于现有工具的漏洞API使用检测性能。

Comments accepted in ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06166 2026-08-07 cs.CY 新提交 50%

What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries

开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试

Germana Bertoli, Ilaria Amelia Caggiano, Francesca Lagioia, Riccardo Rovatti, Giovanni Sartor, Emiliano Troisi

专题命中 代码与定理证明 :planning(abstract)

AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26368 2026-08-06 cs.NI 版本更新 50%

Introducing Large Language Models into the Design Flow of Time-Sensitive Networking

将大语言模型引入时间敏感网络的设计流程

Rubi Debnath, Luxi Zhao, Mohammadreza Barzegaran, Paul Pop, Sebastian Steinhorst

专题命中 代码与定理证明 :planning(abstract)

AI总结 针对配置优化TSN网络的挑战,通过跨模型案例研究评估现有大语言模型能力,提出LLM辅助编排框架,介绍构建模块与管道,分析实际部署机会与局限,为评估LLM辅助TSN编排可行性提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27259 2026-07-31 cs.LO cs.AR 新提交 50%

CircuitProver: Agentic Lean 4 Theorem Proving with Reusable Circuit Proof Library for Hardware Verification

CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证

Ziyi Yang, Wenji Fang, Chen Chen, Zhiyao Xie, Hongce Zhang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17477 2026-07-28 math.GR math.CO 版本更新 50%

On Some Problems from the Kourovka Notebook

关于《库罗夫卡笔记本》中的一些问题

Wouter van Doorn, Elias Judin, Pietro Monticone, Daniel Morrison

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文解决《库罗夫卡笔记本》中八个群论问题,包括构建特定群、证明元素乘积取值情况、说明群阶与统计量不能确定单性、构造算子,还涉及确定生成群、证明幂图性质、探讨子群格情况及反驳秩不等式,且由形式推理主体在Lean中完成。

Comments 21 pages. Lean 4 formalisation: https://github.com/pitmonticone/Kourovka. v2: Expands the appendix with an account on problem selection and adds the MathOverflow provenance of Problem 18.50

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02124 2026-07-23 cs.NI cs.ET 版本更新 50%

FlexNGIA 2.0: Redesigning the Internet with Agentic AI -- Protocols, Services, and Traffic Engineering Designed, Deployed, and Managed by AI

FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程

Mohamed Faten Zhani, Younes Korbi, Yamen Mkadem

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18727 2026-07-22 cs.PL cs.AR 新提交 50%

Formal Verification of an Out-of-Order Multiprocessor against an In-Order Weak-Memory ISA

针对顺序弱内存ISA的乱序多处理器形式验证

Janggun Lee, Jeehoon Kang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18319 2026-07-22 physics.soc-ph 新提交 50%

Mapping the Narrow Corridor with Large Language Models

用大语言模型绘制狭窄走廊

Ebrahim M Songhori

专题命中 代码与定理证明 :chain-of-thought(abstract)

AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16499 2026-07-21 cs.LO cs.SE 新提交 50%

Show Me The Money: An Exercise in Proof-Driven Software Understanding

给我看钱:一个关于证明驱动软件理解的实践

Joseph Tafese, Karthik Nukala, Hassen Saïdi, Natarajan Shankar, Arie Gurfinkel, Giuliano Losa

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究对成熟工业C++代码库进行证明驱动软件理解,结合大语言模型、PVS和SeaHorn,对恒星区块链SDEX订单簿核心算法形式化分析,发现文档不一致,生成便于检查代码更改的工件,展示了定理证明与模型检查组合为遗留系统提供保证的途径。

Comments CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15673 2026-07-20 cs.CR 新提交 50%

Beyond Detection: Agentic Attack Synthesis and Simulation for Smart Contracts

超越检测:智能合约的代理攻击合成与模拟

Xianhao Zhang, Jing Sun, Zijian Zhang, Ye Liu, Zhe Hou, Jiaqi Gao, Yuqiang Sun

专题命中 代码与定理证明 :planning(abstract)

AI总结 研究智能合约漏洞利用验证问题,提出KASS多智能体框架,将自动利用生成分解为多阶段并集成多种机制,在多类智能合约上评估,能成功生成可执行利用及结构化攻击计划,验证效果优于其他工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04667 2026-07-17 cs.SE 版本更新 50%

Correctness, confidence, and context: Framing software assurance in the AI age

正确性、置信度与上下文:在人工智能时代构建软件保障

Mary Shaw

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 探讨软件工程中正确性相关挑战,指出传统方法与生成式人工智能在软件保障上的差异,呼吁系统思考保障技术,做出明智选择。

Comments 12 pages, 10 figures, text for invited keynote at FSE 2026 in Montreal. Revised after the conference to reflect discussions at the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15571 2026-07-17 cs.CC cs.LO math-ph math.CT math.MP 版本更新 50%

Thermodynamic Limits of Proof

物理计数的计算复杂性

Tristan Simas

专题命中 代码与定理证明 :verifier(abstract)

AI总结 研究物理计数的计算复杂性,提出决策商 Q 作为最小抽象,并证明多个复杂性理论结果。

Comments Main PDF: 35 pages, 4 tables. Supplementary: 26 pages, 2 tables. Lean 4 release artifact available at https://doi.org/10.5281/zenodo.18140965

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05820 2026-07-15 cs.SE 版本更新 50%

SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis

通过负测试作为完整性信号的强化学习用于形式规范综合

Zhechong Huang, Zhao Zhang, Zeyu Sun, Huifeng Sun, Yingfei Xiong

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10621 2026-07-14 cs.SE 新提交 50%

WebDesignIter: Co-Evolving Design Knowledge for Repository-Level Front-End Code Generation

WebDesignIter:用于仓库级前端代码生成的协同进化设计知识

Zheng Pei, Mingwei Liu, Zhenxi Chen, Zihao Wang, Yanlin Wang

专题命中 代码与定理证明 :planning(abstract)

AI总结 研究针对前端开发仓库级代码生成问题,提出WebDesignIter框架,通过持久知识图谱融合设计知识与仓库结构,分两阶段工作,实验证明其相比基线和通用编码代理有优势,凸显设计知识对仓库级代码生成的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05593 2026-07-08 cs.HC 新提交 50%

Collective Cognition in Hybrid Groups: A Network Science Synthesis

混合群体中的集体认知:网络科学综合研究

Babak Hemmatian, Razan Baltaji, Lav R. Varshney

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究人工智能代理融入人类团队后混合系统中集体智能的产生,综合网络科学等多学科,通过注意力等视角分析不同网络中集体结果的塑造因素及扩展到混合环境的情况,确定鲁棒效应与需修正之处,得出对相关方面的启示。

Comments Non-authoritative author's version of forthcoming chapter in the Springer Nature Handbook of Hybrid Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 50%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 50%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 代码与定理证明 :planning(abstract)

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04611 2026-06-30 cs.CR cs.SE 50%

PBFuzz: Agentic Directed Fuzzing for PoV Generation

PBFuzz:面向漏洞证明的代理引导模糊测试

Haochen Zeng, Andrew Bao, Jiajun Cheng, Chengyu Song

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 PBFuzz通过模拟人类专家流程,自动提取语义约束并高效生成漏洞证明输入,实验表明其在效率和漏洞触发性能上优于现有方法。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18879 2026-06-30 cs.PL 50%

Adaptive Shielding via Parametric Safety Proofs

基于参数安全证明的自适应防护

Yao Feng, Jun Zhu, André Platzer, Jonathan Laurent

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。

Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25870 2026-06-25 quant-ph 50%

Evolving Quantum Error-Correcting Encodings for Molecular Simulation

面向分子模拟的量子纠错编码演化

Kenny Heitritter, James Brown, Tarini Hardikar

专题命中 代码与定理证明 :verifier(abstract)

AI总结 利用LLM驱动的演化程序合成,发现分子模拟中距离5和6的广义超快编码,并进一步通过压缩导向搜索获得结构化循环构造器。

Comments 16 pages including appendices, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 50%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24443 2026-06-24 cs.LO cs.PL 新提交 50%

Verifiable Auto-Formalization of Mathematics Using a Relaxed Natural Formal Language

使用宽松自然形式语言的可验证数学自动形式化

Zhicheng Hui, Lihan Xie, Xingzhi Qi, Zhehao Li, Yingjun Lan, Qinxiang Cao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 50%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23666 2026-06-23 stat.OT stat.ME 新提交 50%

Statistical Proof as a Window into Human-AI Collaboration: Practical Insights and a Community Agenda

统计证明作为人机协作的窗口:实践见解与社区议程

Xiaojing Sun, Huayu Tang, Buxin Su, Mateo Matijasevick, Chong Wu, Fei Xue, Bingxin Zhao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 通过统计证明任务,发现当前通用大语言模型在精确定义问题下可执行技术组件,但在开放或长链推理中不可靠,提出人机协作中人类专业知识应聚焦于问题构建与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21389 2026-06-23 cs.CR 新提交 50%

From Production SIEM to Reusable Cybersecurity Artifacts

从生产SIEM到可复用的网络安全工件

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏