arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2605.04336 2026-05-18 econ.TH cs.CR cs.GT 50%

The Adversarial Discount -- AI, Signal Correlation, and the Cybersecurity Arms Race

对抗折扣——人工智能、信号相关性与网络安全军备竞赛

James W. Bono

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文研究了对抗投资的竞赛模型,探讨了攻击者和防御者在多个攻击面中分配资源给AI增强能力的过程,分析了信号相关性对军备竞赛比例的影响,并指出信息聚合可能超越私人能力投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12363 2026-05-13 cs.CY cs.HC 50%

Reimagining Assessment in the Age of Generative AI: Lessons from Open-Book Exams with ChatGPT

在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示

Qusay H. Mahmoud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 50%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09794 2026-05-12 cs.IR 50%

LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries

LLM代理使用户主导的个性化超越平台边界

Jiacheng Lin, Kun Qian, Arvind Srinivasan, Tian Wang, Fang Han, Changran Hu, Junze Liu, Ziyi Wang, Hanwen Xu, Mengmeng Xue, Shuo Yang, Hansi Zeng, Simon Sinong Zhan, Kai Zhong, Weiqi Zhang, Dakuo Wang, Tianhao Wang, Zhiyuan Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 50%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26576 2026-05-11 cs.SE 50%

"Show Me You Comply... Without Showing Me Anything": Zero-Knowledge Software Auditing for AI-Enabled Systems

展示你合规...而不展示任何东西:面向AI赋能系统的零知识软件审计

Filippo Scaramuzza, Renato Cordeiro Ferreira, Giovanni Quattrocchi, Damian Andrew Tamburri, Willem-Jan van den Heuvel

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出ZKMLOps框架,通过将零知识证明整合到机器学习运维生命周期中,解决AI系统审计中的透明性与保密性冲突问题,提供可验证的加密证据以满足监管要求。

Comments This work has been submitted to the IEEE Transactions on Software Engineering for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13209 2026-05-05 math.HO 50%

AI for Mathematics: Progress, Challenges, and Prospects

人工智能与数学:进展、挑战与前景

Haocheng Ju, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21272 2026-04-30 cs.CR cs.SE 50%

LLM-Powered Detection of Price Manipulation in DeFi

基于大语言模型的去中心化金融中价格操纵检测

Lu Liu, Wuqi Zhang, Lili Wei, Hao Guan, Yongqiang Tian, Yepang Liu, Shing-Chi Cheung

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18869 2026-04-28 math.CO math.GR math.NT 50%

Global Product Intersection Sets in Semigroups

半群中的全局乘积交集

Wouter van Doorn, Pietro Monticone, Quanyu Tang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文研究了半群中乘积交集的性质,证明了当Q的大小大于等于2时,任何包含1的子集均可作为乘积交集出现,解决了Nathanson提出的问题。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 50%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16524 2026-04-21 cs.CR 50%

Anumati: Proof of Adherence as a Formal Consent Model for Autonomous Agent Protocols

Anumati:作为自主代理协议的合规性证明形式化同意模型

Ravi Kiran Kadaboina

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17330 2026-04-14 cs.SE 50%

Agentic Verification of Software Systems

软件系统的代理验证

Haoxin Tu, Huan Zhao, Yahui Song, Mehtab Zafar, Ruijie Meng, Abhik Roychoudhury

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。

Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08495 2026-04-10 math.OC cs.MA cs.RO cs.SY eess.SY 50%

Density-Driven Optimal Control: Convergence Guarantees for Stochastic LTI Multi-Agent Systems

密度驱动最优控制:随机线性时不变多智能体系统的收敛保证

Kooktae Lee

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业与技术学院)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出随机密度驱动最优控制方法,通过拉格朗日框架实现多智能体系统非均匀区域覆盖,确保在随机LTI动态下时间平均经验分布收敛到非参数目标密度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03872 2026-04-07 cs.LO cs.MA 50%

Strategies in Sabotage Games: Temporal and Epistemic Perspectives

博弈策略:时间与认知视角

Nina Gierasimczuk, Katrine B. P. Thoft

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文从时间视角用ATL$^\ast$分析Sabotage游戏,并探讨其认知扩展中的玩家不确定性,为动态图的时间属性推理提供新框架。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20264 2026-03-24 cs.PL cs.LO 50%

Can LLMs Perform Synthesis?

LLMs能否进行合成?

Derek Egolf, Yuhao Zhou, Stavros Tripakis

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18477 2026-03-20 cs.PL 50%

Leveraging Large Language Models for Generalizing Peephole Optimizations

利用大型语言模型进行通用窥视优化

Chunhao Liao, Hongxu Xu, Xintong Zhou, Zhenyang Xu, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPG框架,利用大型语言模型进行窥视优化泛化,通过闭环工作流整合符号常量泛化、结构泛化、约束放松和位宽/精度泛化,提升优化规则的正确性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06436 2026-03-17 cs.MA 50%

R3R: Decentralized Multi-Agent Collision Avoidance with Infinite-Horizon Safety

R3R:具有无限时间安全性的去中心化多智能体避障

Thomas Marshall Vielmetti, Devansh R. Agrawal, Dimitra Panagou

专题命中 代码与定理证明 :planning(abstract)

AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。

Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 50%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24594 2026-03-11 cs.SE cs.LO 50%

A Tale of 1001 LoC: Potential Runtime Error-Guided Specification Synthesis for Verifying Large-Scale Programs

1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序

Zhongyi Wang, Tengjie Lin, Mingshuai Chen, Haokun Li, Mingqi Yang, Xiao Yi, Shengchao Qin, Yixing Luo, Xiaofeng Li, Bin Gu, Liqiang Lu, Jianwei Yin

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。

Comments Accepted at OOPSLA 2026. Publication date: April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00617 2026-03-03 cs.CY 50%

Dial E for Ethical Enforcement: institutional VETO power as a governance primitive

为伦理执行而 Dial E:作为治理原语的机构 veto 权力

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出机构 veto 权力作为治理原语,旨在通过正式权威阻止潜在武器化风险,推动模型去武装和伦理执行。

Comments Accepted at the AI for Peace Workshop at ICLR 2026.32 Pages and 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00168 2026-02-27 cs.FL cs.LO 50%

Generalised Möbius Categories and Convolution Kleene Algebras

广义莫比乌斯范畴与卷积克里勒代数

James Cranch, Georg Struth, Jana Wagemaker

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出广义莫比乌斯范畴与经典星定义的结合,用于构建卷积克里勒代数,应用于程序验证和高维重写中的代数推理。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15831 2026-02-19 cs.HC cs.MA 50%

A2H: Agent-to-Human Protocol for AI Agent

A2H:AI代理的代理到人类协议

Zhiyuan Liang, Enfang Cui, Qian Wei, Rui She, Tianzheng Li, Minxin Guo, Yujun Cheng

专题命中 代码与定理证明 :planning(abstract)

AI总结 A2H协议通过统一机制使人类成为可发现的可解析实体,推动AI代理向人类连接的智能基础设施发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13212 2026-02-17 cs.RO cs.MA cs.SY eess.SY 50%

UAVGENT: A Language-Guided Distributed Control Framework

UAVGENT: 一种语言引导的分布式控制框架

Ziyi Zhang, Xiyu Deng, Guannan Qu, Yorie Nakahira

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12540 2026-02-16 cs.CV cs.RO 50%

Self-Supervised JEPA-based World Models for LiDAR Occupancy Completion and Forecasting

基于JEPA的世界模型的自监督LiDAR占用完成与预测

Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出AD-LiST-JEPA,一种基于JEPA框架的自监督世界模型,用于自动驾驶中通过LiDAR数据预测未来时空演变,并在占用完成与预测任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04846 2026-02-05 cs.LO cs.PL 50%

CSLib: The Lean Computer Science Library

CSLib: 用于证明计算机科学定理和编写形式验证代码的轻量级框架

Clark Barrett, Swarat Chaudhuri, Fabrizio Montesi, Jim Grundy, Pushmeet Kohli, Leonardo de Moura, Alexandre Rademaker, Sorrachai Yingchareonthawornchai

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CSLib是一个旨在提升Lean在计算机科学领域应用的开源框架,通过增强形式验证能力促进教育与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09696 2026-02-05 cs.HC 50%

Patterns for a New Generation: AI and Agents

新一代的模式:人工智能与代理

Joseph Corneli, Charles J. Danoff, Raymond S. Puzio, Sridevi Ayloo, Sergio Belich, Andre Wilkinson, Mary Tedeschi, Pauline Mosley

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出利用设计模式指导代理行为,展示基于LLM的系统能读取生成模式,并探讨其在软件开发、教育等领域的应用潜力。

Comments 10 pages with 4 page appendix; to appear in Proceedings of Pattern Languages of Programs 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01291 2026-02-03 cs.LO 50%

Construction-Verification: A Benchmark for Applied Mathematics in Lean 4

构造-验证:Lean 4中的应用数学基准

Bowen Yang, Yi Yuan, Chenyi Li, Ziyu Wang, Liangqi Li, Bo Zhang, Zhe Li, Zaiwen Wen

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20764 2026-01-29 cs.DC cs.MA 50%

Agentic Fog: A Policy-driven Framework for Distributed Intelligence in Fog Computing

代理雾:一种基于策略的雾计算分布式智能框架

Saeed Akbar, Muhammad Waqas, Rahmat Ullah

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。

Comments 09 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12845 2026-01-21 cs.SE 50%

Automatic Generation of Formal Specification and Verification Annotations Using LLMs and Test Oracles

利用LLMs和测试或acles自动生成形式规范和验证注解

João Pascoal Faria, Emanuel Trigo, Vinicius Honorato, Rui Abreu

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文利用LLMs和测试或acles自动为Dafny程序生成形式规范和验证注解,实验表明该方法在多数情况下有效,并展示了IDE集成的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏