arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-16 至 2026-04-16 共收录 24 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2503.22760 2026-04-16 cs.CR cs.LG cs.PL 81%

Malicious and Unintentional Disclosure Risks in Large Language Models for Code Generation

大型语言模型在代码生成中的恶意与非故意披露风险

Rafiqul Rabin, Sean McGregor, Nick Judd

机构 * Digital Safety Research Institute(数字安全研究研究院) UL Research Institutes(UL研究机构)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG、cs.PL

AI总结 本文研究了大型语言模型在代码生成训练中可能泄露训练数据中的敏感信息的风险,分析了非故意和恶意披露两种风险,并通过Open Language Model模型评估了不同数据集和模型版本的风险变化。

Comments The 3rd International Workshop on Mining Software Repositories Applications for Privacy and Security (MSR4P&S), co-located with SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29088 2026-04-16 cs.SE cs.AI 81%

WybeCoder: Verified Imperative Code Generation

WybeCoder:验证性 imperative 代码生成

Fabian Gloeckle, Mantas Baksys, Darius Feher, Kunhao Zheng, Amaury Hayat, Sean B. Holden, Gabriel Synnaeve, Peter O'Hearn

机构 * CERMICS, ENPC, Institut Polytechnique de Paris, CNRS(CERMICS,ENPC,巴黎理工学院,CNRS) Computer Lab, University of Cambridge(剑桥大学计算机实验室) Korea Institute for Advanced Study(韩国高级研究院) FAIR, Meta(FAIR,Meta) University College London(伦敦大学学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 WybeCoder 提出了一种验证性 imperative 代码生成框架,通过证明与生成同步的方式,实现代码、不变式和证明的共同进化,提升了复杂算法的验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21751 2026-04-16 cs.SE cs.CL 81%

CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation

CodeFlowBench: 一个用于复杂代码生成的多轮迭代基准

Sizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Shanghai University of Finance and Economics(上海财经大学) McGill University(麦吉尔大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 CodeFlowBench通过多轮迭代重用现有代码评估LLM在复杂代码生成中的能力,包含5000+编程问题和真实GitHub仓库,揭示多轮代码流程中模型性能下降与依赖复杂度负相关的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13046 2026-04-16 cs.DB cs.CL cs.IR cs.LG cs.PL 67%

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

面向LLM驱动触发生成的领域特定语言

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax

机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG、cs.PL

AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。

Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13092 2026-04-16 cs.SE 57%

PlanCompiler: A Deterministic Compilation Architecture for Structured Multi-Step LLM Pipelines

PlanCompiler:一种确定性编译架构用于结构化多步骤LLM流水线

Pranav Harikumar

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 PlanCompiler通过类型节点注册表、静态图验证和确定性编译分离规划与执行,提升结构化LLM流水线的可靠性与效率,实现高成功率和成本效益。

Comments 31 pages, 1 figure, 7 tables, includes appendices and reproduction details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13062 2026-04-16 cs.CL 57%

Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin

增强数学推理的LLM用于公式推导:光纤非线性干扰建模的案例研究

Yao Zhang, Yuchen Song, Xiao Luo, Shengnan Li, Xiaotian Jiang, Min Zhang, Danshi Wang

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出一种增强数学推理的生成AI方法,用于光学通信公式推导,聚焦光纤非线性干扰建模,通过结构化提示引导LLM推导出已知闭式ISRS GN表达式并推导出适用于多段C和C+L波段传输的新近似式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05056 2026-04-16 cs.LG 57%

Modeling Student Learning with 3.8 Million Program Traces

用380万条程序轨迹建模学生学习

Alexis Ross, Megha Srivastava, Jeremiah Blanchard, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) University of Florida(佛罗里达大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文通过分析380万条程序轨迹,探讨训练语言模型以理解学生编程行为及学习过程,发现基于真实轨迹的模型能更准确预测学生行为并生成更正确的代码。

Comments Accepted to 27th International Conference on AI in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15671 2026-04-16 cs.SE 57%

BugScope: Learn to Find Bugs Like Human

BugScope: 像人类一样学习查找错误

Jinyao Guo, Chengpeng Wang, Dominic Deluca, Jinjie Liu, Zhuo Zhang, Xiangyu Zhang

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 BugScope通过模仿人类审计员学习特定错误模式的方式,提出了一种基于三个步骤的代码审计框架,实现了87%的F1分数,优于现有工具。

Comments 22 pages, 3 figures, 10 tables, 4 listings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2604.13107 2026-04-16 cs.SE cs.AI cs.LG 82%

Can Coding Agents Be General Agents?

编码代理可以是通用代理吗?

Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

机构 * Agentic Labs

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文探讨编码代理能否实现端到端业务流程自动化,发现其在简单任务上表现可靠,但在复杂任务上存在瓶颈,指出领域逻辑与代码执行的衔接是通用性关键障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14004 2026-04-16 cs.AI cs.CL 81%

Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents

记忆迁移学习:编码代理跨领域记忆是如何转移的

Kangsan Kim, Minki Kang, Taeil Kim, Yanlai Yang, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了记忆迁移学习,通过统一的记忆池跨异构领域提升编码代理性能,发现高层抽象优于低层痕迹,记忆池规模影响迁移效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13108 2026-04-16 cs.SE cs.AI 81%

Formal Architecture Descriptors as Navigation Primitives for AI Coding Agents

形式架构描述符作为AI编码代理的导航原语

Ruoqi Jin

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文研究了通过提供形式架构描述符减少AI编码代理在代码库探索中的导航开销,通过实验和观察证明了架构描述符在导航效率和错误检测方面的显著提升。

Comments 4 pages, 4 tables, preprint. Code and data: https://doi.org/10.5281/zenodo.19500105

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13120 2026-04-16 cs.SE cs.AI 62%

AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering

AgentForge: 基于执行的多智能体LLM框架用于自主软件工程

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Najma Imtiaz Ali, Shaban Usman

机构 * International Research Center for Complexity Sciences(复杂科学国际研究中心) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北京航空航天大学) College of Science, Mathematics and Technology(科学、数学与技术学院) Wenzhou-Kean University(温州-凯恩大学) Fakulti Teknologi Maklumat dan Komunikasi(信息技术与通信学院) Universiti Teknikal Malaysia Melaka(马来西亚Melaka理工大学) Computer Systems Engineering Department(计算机系统工程系) Sukkur IBA University(苏库尔IBA大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 AgentForge通过引入执行验证原则,提升代码正确性验证,实现40.0%的SWE-BENCH Lite解决率,优于单智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2604.13997 2026-04-16 cs.SE 70%

Learned or Memorized ? Quantifying Memorization Advantage in Code LLMs

学习还是记忆?量化代码大语言模型中的记忆优势

Djiré Albérick Euraste, Kaboré Abdoul Kader, Jordan Samhi, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 程序修复 :code generation(abstract);program repair(abstract);分类 cs.SE

AI总结 本文通过扰动方法量化代码LLM的记忆优势,评估8个开源代码LLM在19个基准测试中的表现,发现任务和模型差异显著,部分基准测试显示低敏感度,挑战了数据泄露的常见担忧。

Comments 12 pages, 12 figures. Accepted at ICSE 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2508.06433 2026-04-16 cs.CL cs.AI cs.LG cs.MA 67%

Memp: Exploring Agent Procedural Memory

Memp:探索代理程序记忆

Runnan Fang, Yuan Liang, Xiaobin Wang, Jialong Wu, Shuofei Qiao, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 57%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13939 2026-04-16 cs.CV 50%

A Multi-Stage Optimization Pipeline for Bethesda Cell Detection in Pap Smear Cytology

一种用于薄层细胞检测的多阶段优化流程

Martin Amster, Camila María Polotto

专题命中 代码评测 :repository(abstract)

AI总结 本文提出了一种基于YOLO和U-Net的多阶段优化流程,用于Pap smear图像中的Bethesda细胞检测,通过重叠去除技术和二分类器提升性能,竞赛中获得第二名。

Comments ISBI 2026 Accepted Paper & Second Place Solution for the RIVA Cervical Cytology Challenge Track B

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2601.13943 2026-04-16 cs.SE 83%

RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository

RepoGenesis:从Readme到仓库的端到端微服务生成基准测试

Zhiyuan Peng, Xin Yin, Pu Zhao, Fangkai Yang, Lu Wang, Ran Jia, Xu Chen, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 仓库级理解 :repository(title,abstract);code generation(abstract);分类 cs.SE

AI总结 本文提出RepoGenesis,首个多语言端到端微服务生成基准测试,包含106个仓库,评估开源代理和商业IDE在代码生成中的表现,揭示架构一致性等缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13725 2026-04-16 cs.SE 79%

On the Effectiveness of Context Compression for Repository-Level Tasks: An Empirical Investigation

在仓库级任务中上下文压缩的有效性:一项实证研究

Jia Feng, Zhanyue Qin, Cuiyun Gao, Ruiqi Wang, Chaozheng Wang, Yingwei Ma, Xiaoyuan Xie

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 本文研究仓库级代码智能任务中上下文压缩的有效性,评估了八种方法的性能与效率,发现连续潜在向量方法在4倍压缩下性能提升达28.3%,效率显著提高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13102 2026-04-16 cs.SE cs.AI 62%

CCCE: A Continuous Code Calibration Engine for Autonomous Enterprise Codebase Maintenance via Knowledge Graph Traversal and Adaptive Decision Gating

CCCE:一种基于知识图谱遍历和自适应决策门控的连续代码校准引擎,用于企业代码库的自主维护

Santhosh Kusuma Kumar Parimi

机构 * Independent Researcher(独立研究员)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CCCE,通过知识图谱遍历和自适应决策门控技术,实现企业代码库的自主维护,减少修复时间并提供端到端可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13100 2026-04-16 cs.SE cs.AI 62%

Contract-Coding: Towards Repo-Level Generation via Structured Symbolic Paradigm

合同编码:通过结构化符号范式实现仓库级生成

Yi Lin, Lujin Zhao, Yijie Shi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出合同编码,通过结构化符号范式解决仓库级生成中意图与代码之间的模糊性问题,实现意图驱动的架构合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14053 2026-04-16 cs.CL 57%

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution

词源何处:通过源归属高效正则化代码分词器

Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov

机构 * CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt(CAIRO应用技术大学(乌尔姆-施维林)) JetBrains Research(JetBrains研究) TU Delft(代尔夫特理工大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文通过源归属BPE(SA-BPE)正则化方法,解决代码分词器因训练数据不平衡导致的冗余token问题,提升分词效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13129 2026-04-16 cs.SE 57%

How Developers Adopt, Use, and Evolve CI/CD Caching: An Empirical Study on GitHub Actions

开发者如何采用、使用和演变CI/CD缓存:一项针对GitHub Actions的实证研究

Kazi Amit Hasan, Yuan Tian, Safwat Hassan, Steven H. H. Ding

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文通过分析952个GitHub仓库,研究开发者在GitHub Actions中配置和演变CI/CD缓存的方式,揭示缓存使用模式及演变驱动因素,量化缓存维护的大量工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2604.13927 2026-04-16 cs.PL 74%

AI Coding Agents Need Better Compiler Remarks

AI 编程代理需要更好的编译器注释

Akash Deo, Simone Campanoni, Tommy McMichen

专题命中 程序分析与验证 :coding agent(title);分类 cs.PL

AI总结 本文研究了编译器注释对AI代理优化程序的影响,发现精确注释能显著提升性能,而模糊注释会导致语义错误,结论是未来编译器需提供结构化反馈以支持自主性能工程。

Comments 3 pages, 1 figure, 2 tables, Presented at Workshop on Co-Design for Agentic and Multimodal AI (CoDAIM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他AI编程 1 篇

2602.18310 2026-04-16 math.CO cs.DM cs.IT math.IT math.PR 50%

Recoverable systems and the maximal hard-core model on the triangular lattice

可恢复系统与三角晶格上的最大硬核模型

Geyang Wang, Alexander Barg, Navin Kashyap

专题命中 其他AI编程 :code model(abstract)

AI总结 研究三角晶格上可恢复系统的容量界、高活动性下的吉布斯测度非唯一性及低活动性下的极值周期吉布斯测度特性。

Comments v2: Improved bound on the activity above which multiple phases occur in the high-activity regime. Extended abstract of this paper appears in Proc. 2026 IEEE International Symposium on Information Theory

详情

展开后加载摘要…

URL PDF HTML 收藏