arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-25 至 2026-06-25 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2606.25195 2026-06-25 cs.CR cs.AI 新提交 83%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 代码生成 :code generation(title,abstract);coding agent(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 81%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 57%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交 57%

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2606.25530 2026-06-25 cs.SE cs.AI cs.CL 新提交 67%

Evaluating LLMs on Real-World Software Performance Optimization

评估大语言模型在真实软件性能优化中的表现

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

机构 * Siemens AG(西门子公司) Technical University of Munich(慕尼黑技术大学) Heilbronn, Germany(德国海德堡) Munich, Germany(德国慕尼黑)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25257 2026-06-25 cs.SE 新提交 57%

How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study

开发者如何维护和演化他们的智能体指令?一项实证研究

Gianmario Voria, Alfonso Cannavale, Andrea De Lucia, Yutaro Kashiwa, Gemma Catolino, Fabio Palomba

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2606.25588 2026-06-25 cs.SE 新提交 57%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 1 篇

2606.25271 2026-06-25 cs.HC 新提交 78%

Co-designing a Preliminary Repository of Augmented Reality Concepts for Real-Time Emotion Regulation

共同设计用于实时情绪调节的增强现实概念初步库

Graciela Camacho-Fidalgo, Edgar Rojas-Muñoz

专题命中 仓库级理解 :repository(title,abstract)

AI总结 通过两阶段参与式设计,结合焦虑倾向个体和心理健康专家的意见,构建了包含8个主题簇和106个设计想法的增强现实干预库,以支持实时情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2606.25244 2026-06-25 cs.PL 新提交 57%

Reading AI Model Compilation in MLIR Through the Lens of Formal Theories

通过形式理论的视角解读MLIR中的AI模型编译

Javed Absar

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL

AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏