Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation
面向执行状态的LLM推理用于自动化漏洞证明生成
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。
Comments Version 1.0 (13 pages, 7 figures)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向执行状态的LLM推理用于自动化漏洞证明生成
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。
Comments Version 1.0 (13 pages, 7 figures)
REAL-Prover:基于检索的Lean证明器用于数学推理
机构 * Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Ubiquant(Ubiquant公司) ; Beijing International Center for Mathematical Research(北京国际数学研究中心)
专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。
专题命中 代码与定理证明 :reasoning(title,abstract)
专题命中 代码与定理证明 :reasoning(title,abstract)
专题命中 代码与定理证明 :reasoning(title,abstract)
Comments 21 pages, 11 Figures, 5 Tables
专题命中 代码与定理证明 :reasoning(title,abstract)
Comments Published in the Proceedings from the 9th International Symposium of NASA Formal Methods, 2017
Journal ref In: Barrett C., Davies M., Kahsai T. (eds) NASA Formal Methods. NFM 2017. Lecture Notes in Computer Science, vol 10227. Springer, Cham
专题命中 代码与定理证明 :reasoning(title,abstract)
Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究
机构 * Shanghai AI Lab(上海人工智能实验室) ; University of Alberta(阿尔伯塔大学) ; Tsinghua University(清华大学) ; Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学) ; Nanyang Technological University(南洋理工大学) ; University of Manchester(曼彻斯特大学) ; Peking University(北京大学)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL
AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。
Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe
基于变压器的高效图灵机模拟
机构 * Shenzhen International Center For Industrial And Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究 institute) ; CRRC Zhuzhou Institute(CRRC 长沙研究所) ; Tengen Intelligence Institute(腾根智能研究院)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出了一种基于变压器的高效图灵机模拟方法,通过优化上下文窗口和CoT步骤,实现了更高效的通用计算。
Comments 19 pages
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * South China University of Technology(华南理工大学) ; Likelihood Lab(Likelihood实验室) ; HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL
Comments 15 pages, 2 figures, 11 tables. Accepted by AACL 2025 main conference
专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);verifier(abstract);分类 cs.AI
感知与敏感性:探讨语义回忆对长上下文代码推理的影响
机构 * Columbia University(哥伦比亚大学)
专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.LG
AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。
Comments Accepted to ACL 2026 (main)
ProofSketcher: 混合LLM + 轻量级证明检查器用于可靠的数学/逻辑推理
机构 * Amazon Web Services, Inc(亚马逊云科技)
专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG
AI总结 本文提出混合方法,结合LLM生成类型化证明草图与轻量级可信内核,以提升数学逻辑推理的可靠性。
机构 * Graduate School of Data Science(数据科学研究生院) ; Faculty of Business(商业学院) ; Kansai University(关西大学) ; Research Promotion Center(研究促进中心) ; Shiga University(守山大学)
专题命中 代码与定理证明 :CoT(title);分类 cs.CL、cs.LG
机构 * Mark Burgess
专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG
Comments Some typos corrected
机构 * Hebrew University of Jerusalem(海法大学) ; MPI for Biological Cybernetics(生物感知研究所) ; Centre for AI and Machine Learning, AU(人工智能与机器学习中心) ; IoPPN, King’s College London(国王学院伦敦人工智能与感知神经科学中心)
专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI
Comments 4 pages, 2 figures, accepted to ACL2025 Findings
专题命中 代码与定理证明 :reasoning(title,comments);分类 cs.AI
Comments Included version of the paper "Automating Agential Reasoning: Proof-Calculi and Syntactic Decidability for STIT Logics", accepted to the 22nd International Conference on Principles and Practice of Multi-Agent Systems (PRIMA 2019)
可解码但不忠实:将自然语言理由与程序化验证器耦合
机构 * AI4Math
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出验证器耦合推理框架,通过一致性训练使验证器信息可从理由表示中解码,但发现可解码性不保证忠实生成,在多个任务中验证了该差距。
Comments Accepted to the ICML 2026 AI4Math Workshop as a poster
解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。
Comments Accepted to the CompLearn Workshop at ICML 2026
学习在非形式定理证明中进行洞察推理
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Ke Holdings Inc.(Ke控股公司) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对非形式定理证明中缺乏洞察(识别核心技巧)的瓶颈,提出统一训练框架DeepInsight,通过分层数据集、渐进式多阶段SFT和基于洞察的策略优化方法,显著提升大语言模型的数学推理能力。
迈向现实工业级验证:基于LLM的定理证明在seL4上的应用
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出AutoReal,一种基于LLM的工业级定理证明方法,通过轻量级本地部署和改进的证明训练,实现了在seL4验证项目中51.67%的证明成功率,并在其他安全项目中达到53.88%的证明成功率。
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments 6 pages, 5 figures
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments 6 pages, 7 figures
专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 41 pages, 6 figures
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments updated to add missing acknowledgements
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2020; 17 pages; 9 figures; 6 tables
Eigenius:具备认知分层与机构介导推理的类型化知识图数据库管理系统
专题命中 代码与定理证明 :reasoning(title);分类 cs.AI
AI总结 Eigenius是一款开源类型化知识图DBMS,通过耦合类型系统等实现数据溯源不变,统一科学认识论,在Nature研究复现中验证了52个结论并发现4处差异。
基于代理建模中的大语言模型驱动推理
机构 * ORNL(橡树岭国家实验室)
专题命中 代码与定理证明 :reasoning(title);分类 cs.AI
AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。