ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense
ARENA: 一种衡量自主网络防御可迁移性的架构
专题命中 代码与定理证明 :verifier(abstract)
AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ARENA: 一种衡量自主网络防御可迁移性的架构
专题命中 代码与定理证明 :verifier(abstract)
AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。
程序分析漫游指南,第三部分:基本无害的LLMs
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。
DIG:面向单日漏洞的Oracle引导定向输入生成
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。
IDDMBSE:集成数据驱动和基于模型的系统工程用于可信自主网络物理系统
机构 * Institute for Systems Research, University of Maryland, College Park(系统研究所,马里兰大学,College Park)
专题命中 代码与定理证明 :planning(abstract)
AI总结 提出IDDMBSE方法,将MBSE V流程与数据驱动循环结合,通过开源工具链PERFECT、TRADES-X和VERITAS实现,在自主地面机器人全生命周期验证其有效性。
Comments 9 pages, 11 figures. This work has been submitted to the IEEE for possible publication
GCD: 乱码、修正、证明——修复并验证Go语言的扩展GCD实现
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文修复了Go标准库中extendedGCD实现的两个偏差,并使用Gobra和Lean进行了形式化验证,证明了正确性和终止性,同时发现AI代理可辅助验证过程。
针对转移偏差的离散系统神经符号鲁棒性分析
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。
Neuroforger: 通过大语言模型为智能合约验证生成认证违规见证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 针对自然语言属性歧义和LLM回答无正确性保证的问题,提出一种结合LLM、类型检查和具体执行的工作流,通过引入扩展Solidity的抽象类型形式规范语言,生成并验证违规见证(反例)。
关于由Rethlas解决的交换代数中一些开放问题
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文报告了使用Rethlas自然语言自动推理系统解决(证明或反驳)的交换代数及相关领域的一系列开放问题,并给出了精确陈述和自包含证明。
Comments 13 pages. AI-generated, human verified
Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。
隐性信号基础设施:迈向随时间建模专家感知的AI系统
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出隐性信号基础设施,通过长期认知操作和认知运营管理器,使AI系统能够建模专家随时间变化的隐性感知,从而超越显性知识处理。
Comments 17 pages, 2 figures
QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别
机构 * University of Sydney(悉尼大学) ; University of New South Wales(新南威尔士大学)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。
对抗折扣——人工智能、信号相关性与网络安全军备竞赛
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文研究了对抗投资的竞赛模型,探讨了攻击者和防御者在多个攻击面中分配资源给AI增强能力的过程,分析了信号相关性对军备竞赛比例的影响,并指出信息聚合可能超越私人能力投资。
在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。
代理模糊测试:机遇与挑战
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。
LLM代理使用户主导的个性化超越平台边界
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。
基于大语言模型的符号系统学习方法
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。
展示你合规...而不展示任何东西:面向AI赋能系统的零知识软件审计
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文提出ZKMLOps框架,通过将零知识证明整合到机器学习运维生命周期中,解决AI系统审计中的透明性与保密性冲突问题,提供可验证的加密证据以满足监管要求。
Comments This work has been submitted to the IEEE Transactions on Software Engineering for possible publication
人工智能与数学:进展、挑战与前景
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。
基于大语言模型的去中心化金融中价格操纵检测
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。
半群中的全局乘积交集
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文研究了半群中乘积交集的性质,证明了当Q的大小大于等于2时,任何包含1的子集均可作为乘积交集出现,解决了Nathanson提出的问题。
Comments 8 pages
在Java漏洞发现中 contextualizing sink knowledge
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。
Anumati:作为自主代理协议的合规性证明形式化同意模型
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。
Comments 25 pages, 5 figures
软件系统的代理验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。
Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
密度驱动最优控制:随机线性时不变多智能体系统的收敛保证
机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业与技术学院)
专题命中 代码与定理证明 :planning(abstract)
AI总结 本文提出随机密度驱动最优控制方法,通过拉格朗日框架实现多智能体系统非均匀区域覆盖,确保在随机LTI动态下时间平均经验分布收敛到非参数目标密度。
博弈策略:时间与认知视角
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文从时间视角用ATL$^\ast$分析Sabotage游戏,并探讨其认知扩展中的玩家不确定性,为动态图的时间属性推理提供新框架。
Comments 18 pages, 3 figures
LLMs能否进行合成?
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。
利用大型语言模型进行通用窥视优化
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LPG框架,利用大型语言模型进行窥视优化泛化,通过闭环工作流整合符号常量泛化、结构泛化、约束放松和位宽/精度泛化,提升优化规则的正确性和通用性。
R3R:具有无限时间安全性的去中心化多智能体避障
专题命中 代码与定理证明 :planning(abstract)
AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。
Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026
LPO:利用大语言模型发现遗漏的窥视优化
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。
Comments Accepted at ASPLOS 2026
Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)
1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。
Comments Accepted at OOPSLA 2026. Publication date: April 2026