arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1124 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1124 篇

2606.21377 2026-06-23 cs.CR 新提交 50%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15122 2026-06-16 cs.SE 新提交 50%

The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs

程序分析漫游指南,第三部分:基本无害的LLMs

Haonan Li, Tianyang Zhou, Manu Sridharan, Hang Zhang, Zhiyun Qian

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13037 2026-06-12 cs.CR cs.SE 新提交 50%

DIG: Oracle-Guided Directed Input Generation for One-Day Vulnerabilities

DIG:面向单日漏洞的Oracle引导定向输入生成

Andrew Bao, Haochen Zeng, Peng Chen, Stephen McCamant, Pen-Chung Yew

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06727 2026-06-08 cs.RO cs.SY eess.SY 新提交 50%

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems

IDDMBSE:集成数据驱动和基于模型的系统工程用于可信自主网络物理系统

John S. Baras, Sai Sandeep Damera, Ryan Matheu, Clinton Enwerem, Praveen M. S. Kumar

机构 * Institute for Systems Research, University of Maryland, College Park(系统研究所,马里兰大学,College Park)

专题命中 代码与定理证明 :planning(abstract)

AI总结 提出IDDMBSE方法,将MBSE V流程与数据驱动循环结合,通过开源工具链PERFECT、TRADES-X和VERITAS实现,在自主地面机器人全生命周期验证其有效性。

Comments 9 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05796 2026-06-08 cs.CR 版本更新 50%

GCD: Garbled, Corrected, Demonstrandum -- Fixing and Proving Go's Extended GCD Implementation

GCD: 乱码、修正、证明——修复并验证Go语言的扩展GCD实现

Linard Arquint

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文修复了Go标准库中extendedGCD实现的两个偏差,并使用Gobra和Lean进行了形式化验证,证明了正确性和终止性,同时发现AI代理可辅助验证过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03872 2026-06-03 eess.SY cs.SY 50%

NeuroSymbolic Robustness Analysis for Discrete Systems with Respect to Transition Deviations

针对转移偏差的离散系统神经符号鲁棒性分析

Shih-Jie Shih, Jonghan Lim, Ilya Kovalenko, Rômulo Meira-Góes

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31389 2026-06-01 cs.PL cs.CR 50%

Neuroforger: certified violation witnesses for smart contracts verification via LLMs

Neuroforger: 通过大语言模型为智能合约验证生成认证违规见证

Massimo Bartoletti, Enrico Lipparini

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对自然语言属性歧义和LLM回答无正确性保证的问题,提出一种结合LLM、类型检查和具体执行的工作流,通过引入扩展Solidity的抽象类型形式规范语言,生成并验证违规见证(反例)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25259 2026-05-29 math.AC 50%

On some open problems in commutative algebra resolved by Rethlas

关于由Rethlas解决的交换代数中一些开放问题

Jiedong Jiang, Yixiao Li, Zeming Sun, Yuefeng Wang, Liang Xiao, Jiahong Yu

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文报告了使用Rethlas自然语言自动推理系统解决(证明或反驳)的交换代数及相关领域的一系列开放问题,并给出了精确陈述和自包含证明。

Comments 13 pages. AI-generated, human verified

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-05-26 cs.CR cs.SC 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24332 2026-05-26 cs.HC 50%

Tacit Signal Infrastructure: Towards AI Systems that Model Expert Sensing Over Time

隐性信号基础设施:迈向随时间建模专家感知的AI系统

Annie Yuan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出隐性信号基础设施,通过长期认知操作和认知运营管理器,使AI系统能够建模专家随时间变化的隐性感知,从而超越显性知识处理。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20584 2026-05-21 cs.CV 50%

QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别

Dishanika Denipitiyage, Aruna Seneviratne, Suranga Seneviratne

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04336 2026-05-18 econ.TH cs.CR cs.GT 50%

The Adversarial Discount -- AI, Signal Correlation, and the Cybersecurity Arms Race

对抗折扣——人工智能、信号相关性与网络安全军备竞赛

James W. Bono

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文研究了对抗投资的竞赛模型,探讨了攻击者和防御者在多个攻击面中分配资源给AI增强能力的过程,分析了信号相关性对军备竞赛比例的影响,并指出信息聚合可能超越私人能力投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12363 2026-05-13 cs.CY cs.HC 50%

Reimagining Assessment in the Age of Generative AI: Lessons from Open-Book Exams with ChatGPT

在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示

Qusay H. Mahmoud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 50%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09794 2026-05-12 cs.IR 50%

LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries

LLM代理使用户主导的个性化超越平台边界

Jiacheng Lin, Kun Qian, Arvind Srinivasan, Tian Wang, Fang Han, Changran Hu, Junze Liu, Ziyi Wang, Hanwen Xu, Mengmeng Xue, Shuo Yang, Hansi Zeng, Simon Sinong Zhan, Kai Zhong, Weiqi Zhang, Dakuo Wang, Tianhao Wang, Zhiyuan Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 50%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26576 2026-05-11 cs.SE 50%

"Show Me You Comply... Without Showing Me Anything": Zero-Knowledge Software Auditing for AI-Enabled Systems

展示你合规...而不展示任何东西:面向AI赋能系统的零知识软件审计

Filippo Scaramuzza, Renato Cordeiro Ferreira, Giovanni Quattrocchi, Damian Andrew Tamburri, Willem-Jan van den Heuvel

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出ZKMLOps框架,通过将零知识证明整合到机器学习运维生命周期中,解决AI系统审计中的透明性与保密性冲突问题,提供可验证的加密证据以满足监管要求。

Comments This work has been submitted to the IEEE Transactions on Software Engineering for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13209 2026-05-05 math.HO 50%

AI for Mathematics: Progress, Challenges, and Prospects

人工智能与数学:进展、挑战与前景

Haocheng Ju, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21272 2026-04-30 cs.CR cs.SE 50%

LLM-Powered Detection of Price Manipulation in DeFi

基于大语言模型的去中心化金融中价格操纵检测

Lu Liu, Wuqi Zhang, Lili Wei, Hao Guan, Yongqiang Tian, Yepang Liu, Shing-Chi Cheung

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18869 2026-04-28 math.CO math.GR math.NT 50%

Global Product Intersection Sets in Semigroups

半群中的全局乘积交集

Wouter van Doorn, Pietro Monticone, Quanyu Tang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文研究了半群中乘积交集的性质,证明了当Q的大小大于等于2时,任何包含1的子集均可作为乘积交集出现,解决了Nathanson提出的问题。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 50%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16524 2026-04-21 cs.CR 50%

Anumati: Proof of Adherence as a Formal Consent Model for Autonomous Agent Protocols

Anumati:作为自主代理协议的合规性证明形式化同意模型

Ravi Kiran Kadaboina

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17330 2026-04-14 cs.SE 50%

Agentic Verification of Software Systems

软件系统的代理验证

Haoxin Tu, Huan Zhao, Yahui Song, Mehtab Zafar, Ruijie Meng, Abhik Roychoudhury

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。

Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08495 2026-04-10 math.OC cs.MA cs.RO cs.SY eess.SY 50%

Density-Driven Optimal Control: Convergence Guarantees for Stochastic LTI Multi-Agent Systems

密度驱动最优控制:随机线性时不变多智能体系统的收敛保证

Kooktae Lee

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业与技术学院)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出随机密度驱动最优控制方法,通过拉格朗日框架实现多智能体系统非均匀区域覆盖,确保在随机LTI动态下时间平均经验分布收敛到非参数目标密度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03872 2026-04-07 cs.LO cs.MA 50%

Strategies in Sabotage Games: Temporal and Epistemic Perspectives

博弈策略:时间与认知视角

Nina Gierasimczuk, Katrine B. P. Thoft

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文从时间视角用ATL$^\ast$分析Sabotage游戏,并探讨其认知扩展中的玩家不确定性,为动态图的时间属性推理提供新框架。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20264 2026-03-24 cs.PL cs.LO 50%

Can LLMs Perform Synthesis?

LLMs能否进行合成?

Derek Egolf, Yuhao Zhou, Stavros Tripakis

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18477 2026-03-20 cs.PL 50%

Leveraging Large Language Models for Generalizing Peephole Optimizations

利用大型语言模型进行通用窥视优化

Chunhao Liao, Hongxu Xu, Xintong Zhou, Zhenyang Xu, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPG框架,利用大型语言模型进行窥视优化泛化,通过闭环工作流整合符号常量泛化、结构泛化、约束放松和位宽/精度泛化,提升优化规则的正确性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06436 2026-03-17 cs.MA 50%

R3R: Decentralized Multi-Agent Collision Avoidance with Infinite-Horizon Safety

R3R:具有无限时间安全性的去中心化多智能体避障

Thomas Marshall Vielmetti, Devansh R. Agrawal, Dimitra Panagou

专题命中 代码与定理证明 :planning(abstract)

AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。

Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 50%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24594 2026-03-11 cs.SE cs.LO 50%

A Tale of 1001 LoC: Potential Runtime Error-Guided Specification Synthesis for Verifying Large-Scale Programs

1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序

Zhongyi Wang, Tengjie Lin, Mingshuai Chen, Haokun Li, Mingqi Yang, Xiao Yi, Shengchao Qin, Yixing Luo, Xiaofeng Li, Bin Gu, Liqiang Lu, Jianwei Yin

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。

Comments Accepted at OOPSLA 2026. Publication date: April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏