The Adversarial Discount -- AI, Signal Correlation, and the Cybersecurity Arms Race
对抗折扣——人工智能、信号相关性与网络安全军备竞赛
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文研究了对抗投资的竞赛模型,探讨了攻击者和防御者在多个攻击面中分配资源给AI增强能力的过程,分析了信号相关性对军备竞赛比例的影响,并指出信息聚合可能超越私人能力投资。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
对抗折扣——人工智能、信号相关性与网络安全军备竞赛
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文研究了对抗投资的竞赛模型,探讨了攻击者和防御者在多个攻击面中分配资源给AI增强能力的过程,分析了信号相关性对军备竞赛比例的影响,并指出信息聚合可能超越私人能力投资。
在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。
代理模糊测试:机遇与挑战
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。
LLM代理使用户主导的个性化超越平台边界
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。
基于大语言模型的符号系统学习方法
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。
展示你合规...而不展示任何东西:面向AI赋能系统的零知识软件审计
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文提出ZKMLOps框架,通过将零知识证明整合到机器学习运维生命周期中,解决AI系统审计中的透明性与保密性冲突问题,提供可验证的加密证据以满足监管要求。
Comments This work has been submitted to the IEEE Transactions on Software Engineering for possible publication
人工智能与数学:进展、挑战与前景
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。
基于大语言模型的去中心化金融中价格操纵检测
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。
半群中的全局乘积交集
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文研究了半群中乘积交集的性质,证明了当Q的大小大于等于2时,任何包含1的子集均可作为乘积交集出现,解决了Nathanson提出的问题。
Comments 8 pages
在Java漏洞发现中 contextualizing sink knowledge
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。
Anumati:作为自主代理协议的合规性证明形式化同意模型
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。
Comments 25 pages, 5 figures
软件系统的代理验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。
Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
密度驱动最优控制:随机线性时不变多智能体系统的收敛保证
机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业与技术学院)
专题命中 代码与定理证明 :planning(abstract)
AI总结 本文提出随机密度驱动最优控制方法,通过拉格朗日框架实现多智能体系统非均匀区域覆盖,确保在随机LTI动态下时间平均经验分布收敛到非参数目标密度。
博弈策略:时间与认知视角
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文从时间视角用ATL$^\ast$分析Sabotage游戏,并探讨其认知扩展中的玩家不确定性,为动态图的时间属性推理提供新框架。
Comments 18 pages, 3 figures
LLMs能否进行合成?
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。
利用大型语言模型进行通用窥视优化
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LPG框架,利用大型语言模型进行窥视优化泛化,通过闭环工作流整合符号常量泛化、结构泛化、约束放松和位宽/精度泛化,提升优化规则的正确性和通用性。
R3R:具有无限时间安全性的去中心化多智能体避障
专题命中 代码与定理证明 :planning(abstract)
AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。
Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026
LPO:利用大语言模型发现遗漏的窥视优化
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。
Comments Accepted at ASPLOS 2026
Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)
1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。
Comments Accepted at OOPSLA 2026. Publication date: April 2026
为伦理执行而 Dial E:作为治理原语的机构 veto 权力
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出机构 veto 权力作为治理原语,旨在通过正式权威阻止潜在武器化风险,推动模型去武装和伦理执行。
Comments Accepted at the AI for Peace Workshop at ICLR 2026.32 Pages and 2 Figures
广义莫比乌斯范畴与卷积克里勒代数
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出广义莫比乌斯范畴与经典星定义的结合,用于构建卷积克里勒代数,应用于程序验证和高维重写中的代数推理。
Comments 40 pages
A2H:AI代理的代理到人类协议
专题命中 代码与定理证明 :planning(abstract)
AI总结 A2H协议通过统一机制使人类成为可发现的可解析实体,推动AI代理向人类连接的智能基础设施发展。
UAVGENT: 一种语言引导的分布式控制框架
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。
基于JEPA的世界模型的自监督LiDAR占用完成与预测
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 代码与定理证明 :planning(abstract)
AI总结 本文提出AD-LiST-JEPA,一种基于JEPA框架的自监督世界模型,用于自动驾驶中通过LiDAR数据预测未来时空演变,并在占用完成与预测任务中验证其有效性。
代理EDA的黎明:自主数字芯片设计的综述
专题命中 代码与定理证明 :planning(abstract)
AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。
CSLib: 用于证明计算机科学定理和编写形式验证代码的轻量级框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 CSLib是一个旨在提升Lean在计算机科学领域应用的开源框架,通过增强形式验证能力促进教育与研究。
新一代的模式:人工智能与代理
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出利用设计模式指导代理行为,展示基于LLM的系统能读取生成模式,并探讨其在软件开发、教育等领域的应用潜力。
Comments 10 pages with 4 page appendix; to appear in Proceedings of Pattern Languages of Programs 2025
构造-验证:Lean 4中的应用数学基准
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。
代理雾:一种基于策略的雾计算分布式智能框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。
Comments 09 Pages
利用LLMs和测试或acles自动生成形式规范和验证注解
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文利用LLMs和测试或acles自动为Dafny程序生成形式规范和验证注解,实验表明该方法在多数情况下有效,并展示了IDE集成的可行性。