arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-25 至 2026-06-25 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2606.25195 2026-06-25 cs.CR cs.AI 新提交 83%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 代码生成 :code generation(title,abstract);coding agent(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 81%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06216 2026-06-25 cs.SE cs.AI 版本更新 62%

Agentic Software Engineering: Foundational Pillars and a Research Roadmap

代理软件工程:基础支柱与研究路线图

Ahmed E. Hassan, Hao Li, Dayi Lin, Bram Adams, Tse-Hsun Chen, Yutaro Kashiwa, Dong Qiu

机构 * Queen's University(女王大学) Concordia University(Concordia大学) Nara Institute of Science and Technology(奈ara科学和技术研究院) Huawei Canada(华为加拿大)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出代理软件工程(SE 3.0)时代,以“面向人类的SE”和“面向代理的SE”双重模式为基础,重新定义软件工程支柱,并设计代理命令环境(ACE)和代理执行环境(AEE)两种工作台,实现双向人机协作,推动从代理编码到真正代理软件工程的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 57%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交 57%

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25870 2026-06-25 quant-ph 50%

Evolving Quantum Error-Correcting Encodings for Molecular Simulation

面向分子模拟的量子纠错编码演化

Kenny Heitritter, James Brown, Tarini Hardikar

专题命中 代码生成 :program synthesis(abstract)

AI总结 利用LLM驱动的演化程序合成,发现分子模拟中距离5和6的广义超快编码,并进一步通过压缩导向搜索获得结构化循环构造器。

Comments 16 pages including appendices, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2602.11988 2026-06-25 cs.SE cs.AI 版本更新 88%

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

机构 * Department of Computer Science(计算机科学系) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25530 2026-06-25 cs.SE cs.AI cs.CL 新提交 67%

Evaluating LLMs on Real-World Software Performance Optimization

评估大语言模型在真实软件性能优化中的表现

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

机构 * Siemens AG(西门子公司) Technical University of Munich(慕尼黑技术大学) Heilbronn, Germany(德国海德堡) Munich, Germany(德国慕尼黑)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 67%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25257 2026-06-25 cs.SE 新提交 57%

How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study

开发者如何维护和演化他们的智能体指令?一项实证研究

Gianmario Voria, Alfonso Cannavale, Andrea De Lucia, Yutaro Kashiwa, Gemma Catolino, Fabio Palomba

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29919 2026-06-25 cs.SE 版本更新 57%

SkillReducer: Optimizing LLM Agent Skills for Token Efficiency

SkillReducer: 优化LLM代理技能的令牌效率

Yudong Gao, Zongjie Li, Yuanyuan Yuan, Zimo Ji, Pingchuan Ma, Shuai Wang

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2606.25588 2026-06-25 cs.SE 新提交 57%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2606.25271 2026-06-25 cs.HC 新提交 78%

Co-designing a Preliminary Repository of Augmented Reality Concepts for Real-Time Emotion Regulation

共同设计用于实时情绪调节的增强现实概念初步库

Graciela Camacho-Fidalgo, Edgar Rojas-Muñoz

专题命中 仓库级理解 :repository(title,abstract)

AI总结 通过两阶段参与式设计,结合焦虑倾向个体和心理健康专家的意见,构建了包含8个主题簇和106个设计想法的增强现实干预库,以支持实时情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05242 2026-06-25 cs.SE cs.AI 62%

Learning to Code with Context: A Study-Based Approach

基于情境的学习:一种基于研究的方法

Uwe M. Borghoff, Mark Minas, Jannis Schopp

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了如何在软件开发过程中利用生成式AI工具,通过大学编程项目中的用户研究,探讨了AI辅助在真实开发实践中的应用,分析了工具的有效性及学生遇到的挑战。

Comments 36 pages, 7 figures, 5 tables

Journal ref Software 2026, 5(2), 27

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2606.25244 2026-06-25 cs.PL 新提交 57%

Reading AI Model Compilation in MLIR Through the Lens of Formal Theories

通过形式理论的视角解读MLIR中的AI模型编译

Javed Absar

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL

AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏