arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 128 篇

2606.22413 2026-06-24 cs.SE cs.FL 新提交 50%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23666 2026-06-23 stat.OT stat.ME 新提交 50%

Statistical Proof as a Window into Human-AI Collaboration: Practical Insights and a Community Agenda

统计证明作为人机协作的窗口:实践见解与社区议程

Xiaojing Sun, Huayu Tang, Buxin Su, Mateo Matijasevick, Chong Wu, Fei Xue, Bingxin Zhao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 通过统计证明任务,发现当前通用大语言模型在精确定义问题下可执行技术组件,但在开放或长链推理中不可靠,提出人机协作中人类专业知识应聚焦于问题构建与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21389 2026-06-23 cs.CR 新提交 50%

From Production SIEM to Reusable Cybersecurity Artifacts

从生产SIEM到可复用的网络安全工件

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 50%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15122 2026-06-16 cs.SE 新提交 50%

The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs

程序分析漫游指南,第三部分:基本无害的LLMs

Haonan Li, Tianyang Zhou, Manu Sridharan, Hang Zhang, Zhiyun Qian

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13037 2026-06-12 cs.CR cs.SE 新提交 50%

DIG: Oracle-Guided Directed Input Generation for One-Day Vulnerabilities

DIG:面向单日漏洞的Oracle引导定向输入生成

Andrew Bao, Haochen Zeng, Peng Chen, Stephen McCamant, Pen-Chung Yew

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06727 2026-06-08 cs.RO cs.SY eess.SY 新提交 50%

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems

IDDMBSE:集成数据驱动和基于模型的系统工程用于可信自主网络物理系统

John S. Baras, Sai Sandeep Damera, Ryan Matheu, Clinton Enwerem, Praveen M. S. Kumar

机构 * Institute for Systems Research, University of Maryland, College Park(系统研究所,马里兰大学,College Park)

专题命中 代码与定理证明 :planning(abstract)

AI总结 提出IDDMBSE方法,将MBSE V流程与数据驱动循环结合,通过开源工具链PERFECT、TRADES-X和VERITAS实现,在自主地面机器人全生命周期验证其有效性。

Comments 9 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏