arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 程序分析与验证 11 篇

2607.08339 2026-07-10 cs.CL cs.AI cs.PL 新提交 82%

TypeProbe: Recovering Type Representations from Hidden States of Pre-trained Code Models

TypeProbe:从预训练代码模型的隐藏状态中恢复类型表示

Giuliano Gorgone, Fausto Carcassi

机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学)

专题命中 程序分析与验证 :code model(title,abstract);分类 cs.CL、cs.AI、cs.PL

AI总结 研究代码模型内部编码类型信息的情况,利用Java和Python代码示例的并行数据集探测预训练代码模型的残差流获取类型表示,发现跨语言类型表示等结果,且结构对一些变化有鲁棒性,还发布了代码和数据集。

Comments 18 pages, 12 figures. Accepted at ESSLLI 2026 (StuS; double-blind)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21491 2026-07-24 cs.CL cs.LG 新提交 76%

What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations

是什么、在哪里以及如何:解开任务、语言和模型在代码模型表示中的作用

Piotr Wilam

机构 * University College London(伦敦大学学院)

专题命中 程序分析与验证 :code model(title);分类 cs.CL、cs.LG

AI总结 研究独立训练的语言模型在代码表示上的情况,通过2x2设计扩展概念电路提取方法,测量语法概念,发现任务决定概念获专用电路,模型决定电路位置及增长方式,还得出如Rust与Python电路差异等结论,为后续测试奠定基础。

Comments 16 pages, 11 figures, 6 tables. Code: https://github.com/piotrwilam/Atlas2x2 ; dataset: https://huggingface.co/datasets/piotrwilam/Atlas2x2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 70%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 程序分析与验证 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10906 2026-08-12 cs.SE cs.AI 新提交 62%

GitSkills: A Dataset of Agent Skills on GitHub

GitSkills:GitHub上的智能体技能数据集

Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, Marco Ortu

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出GitSkills数据集,包含从28.22万个公开GitHub代码库收集的379.7117万个智能体技能相关文件,为智能体技能的多维度研究提供了数据支撑。

Comments Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, and Marco Ortu. 2027. GitSkills: A Dataset of Agent Skills on GitHub. In Proceedings of the 24th International Conference on Mining Software Repositories (MSR '27). Association for Computing Machinery, New York, NY, USA, 3 pages. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07217 2026-07-09 cs.SE cs.CR cs.PL 新提交 62%

Finding and Understanding Miscompilation Bugs in the Solidity Compiler

在Solidity编译器中发现并理解错误编译漏洞

Bhargava Shastry

专题命中 程序分析与验证 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 研究旨在提高Solidity编译器质量,创建SolSmith工具。通过生成有效测试程序使编译器测试更严格,发现25个错误编译漏洞。还对这些漏洞进行定性和定量分析,揭示优化编译器的陷阱,为智能合约及用户减少潜在风险。

Comments 16 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02370 2026-07-07 cs.SE cs.AI 新提交 62%

Understanding Agent-Based Patching of Compiler Missed Optimizations

理解基于智能体的编译器遗漏优化补丁

Batu Guan, Zirui Wang, Shaohua Li

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体如何为编译器遗漏优化打补丁,发现关键挑战在于泛化而非仅修复报告案例,提出历史知识增强技术以提升泛化能力。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13298 2026-06-12 cs.SE cs.AI 新提交 62%

Mining Architectural Quality Under Agentic AI Adoption: A Causal Study of Java Repositories

在智能体AI采用下的架构质量挖掘:Java仓库的因果研究

Oliver Aleksander Larsen, Mahyar T. Moghaddam

机构 * SDU Software Engineering, University of Southern Denmark(SDU软件工程,丹麦南部大学)

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE、cs.AI

AI总结 通过差分差分设计和Borusyak插值估计器,研究智能体AI工具采用对Java仓库架构气味密度(ASD)的因果影响,发现ASD下降6.7%源于代码量增长,而非架构改进。

Comments 16 pages. Accepted for presentation at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026, Krakow, Poland, 2-4 September 2026, and for publication in the Springer LNCS proceedings. This is the author's accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00555 2026-07-02 cs.SE 新提交 57%

Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs

从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析

Shaoyu Yang, Haifeng Lin, Chunrong Fang, Xiang Chen, Wei Cheng, Jiawei Liu, Yiyu Zhang, Hongyu Liu, Zhenyu Chen

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE

AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25244 2026-06-25 cs.PL 新提交 57%

Reading AI Model Compilation in MLIR Through the Lens of Formal Theories

通过形式理论的视角解读MLIR中的AI模型编译

Javed Absar

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL

AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19149 2026-06-19 cs.CR cs.LG 新提交 57%

OpenAnt: LLM-Powered Vulnerability Discovery Through Code Decomposition, Adversarial Verification, and Dynamic Testing

OpenAnt:通过代码分解、对抗性验证和动态测试实现LLM驱动的漏洞发现

Nahum Korda, Gadi Evron

专题命中 程序分析与验证 :repository(abstract);分类 cs.LG

AI总结 提出OpenAnt系统,结合静态分析与LLM推理,通过代码分解、对抗性验证和动态测试三阶段流水线,在降低误报率的同时发现未知漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29291 2026-08-03 cs.SC cs.LO 新提交 50%

SAT Certificates for the Matrix-Multiplication Challenges over F2: All Ten `Expected-UNSAT` Instances Are Satisfiable, and a Type-3-Free Rank-23 Scheme

F₂上矩阵乘法挑战的SAT证书:全部10个“预期不可满足”实例均可满足,以及一个无3型项的秩23方案

Nick Palladinos

专题命中 程序分析与验证 :repository(abstract)

AI总结 该研究针对F₂上的矩阵乘法SAT基准,发现10个预期不可满足的Challenge-2公式实际可满足,还构造了无3型项的秩23方案,生成了21个实例的SAT证书且可快速复现。

详情

展开后加载摘要…

URL PDF HTML 收藏