arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-08 至 2026-06-08 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2511.03898 2026-06-08 cs.CR cs.AI cs.CE cs.SE 81%

Secure Code Generation at Scale with Reflexion

大规模安全代码生成中的反射

Arup Datta, Ahmed Aljohani, Hyunsook Do

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究评估了使用Instruct Prime和反射提示方法提升代码安全性的效果,发现反射提示能显著提高安全性能,尤其在第一轮提示中效果最明显。

Comments Accepted for publication at the 2nd IEEE International Conference on AI-powered Software (AIware 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06826 2026-06-08 cs.SE 新提交 79%

SkelDPO: A Skeleton-Guided Direct Preference Optimization Framework for Efficient Code Generation

SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成

Yu Yu, Chen Lyu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06821 2026-06-08 cs.SE 新提交 79%

Chiseling Out Efficiency: Structured Skeleton Supervision for Efficient Code Generation

剔除低效:用于高效代码生成的结构骨架监督

Yu Yu, Zhihong Sun, Jia Li, Yao Wan, Chuanyi Li, Hongyu Zhang, Ruyun Wang, Tao Huang, Zhi Jin, Ge Li, Chen Lyu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出EffiSkel框架,通过提取和学习效率骨架,提升代码生成的效率与正确性,实验显示在多个编程语言和基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17548 2026-06-08 cs.SE cs.AI 版本更新 62%

Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review

重新思考AI时代的代码审查:面向代理代码审查的愿景

Hüseyin Özgür Kamalı, Erdem Tuna, Vahid Haratian, Eray Tüzün

机构 * Microsoft(微软) Ankara University(安卡拉大学) Bilkent University(比尔肯特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了在AI时代代码审查的演变,提出了一种结合专门代理和人类控制的质量闸门的AI驱动代码审查流程,旨在提升代码审查的效率和可靠性。

Comments Submitted to ACM Transactions on Software Engineering Methodology (TOSEM). A shorter version of this work has been presented at ICSE-JAWs 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新 62%

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06843 2026-06-08 cs.SE 新提交 57%

Empirical Study on the Characteristics and Evolution of AI-usage in GitHub Repositories: Evidence from Code Comments

GitHub仓库中AI使用特征与演化的实证研究:来自代码注释的证据

Abdullah Al Mujahid, Preetha Chatterjee, Mia Mohammad Imran

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 通过分析35,361条提及AI的GitHub代码注释及后续提交,发现开发者主要用LLM实现代码,随后频繁重构、集成和修复,AI引用从代码生成转向知识支持和代码增强。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04894 2026-06-08 cs.CR cs.AI 版本更新 57%

Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software

从黑盒LLM生成的软件中提取重复漏洞

Tomer Kordonsky, Amit LeVi, Maayan Yamin, Noam Benzimra, Avi Mendelson

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出特征-安全表(FSTab),通过黑盒攻击从前端特征预测后端漏洞,并量化模型跨程序、重述和领域的漏洞复现一致性,实验显示跨域攻击成功率高达94%。

Comments ICML 2026, Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2606.07297 2026-06-08 cs.SE cs.CL 新提交 84%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04226 2026-06-08 cs.MA cs.AI 版本更新 83%

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

SW-$A^2$-Bench: 面向智能体网络的自主软件智能体生成基准测试

Linyao Chen, Bo Huang, Qinlao Zhao, Shuai Shao, Zhi Han, Zicai Cui, Ziheng Zhang, Guangtao Zeng, Wenzheng Tang, Yikun Wang, Yuanjian Zhou, Zimian Peng, Yong Yu, Weiwen Liu, Hiroki Kobayashi, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学) Queen’s University(女王大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :software agent(title,abstract);coding agent(abstract);分类 cs.AI

AI总结 提出首个软件智能体生成基准SW-$A^2$-Bench,通过编码智能体自动将代码仓库转化为自主软件智能体,评估生成智能体的忠实性与互操作性,以扩展智能体网络规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07448 2026-06-08 cs.SE 新提交 79%

Agentic Very Much! Adoption of Coding Agent in New GitHub Projects

Agentic Very Much! 新GitHub项目中编码助手的采用

Romain Robbes, Théo Matricon, Thomas Degueule, Andre Hora, Stefano Zacchiroli

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究新创建的GitHub项目中编码助手的采用情况,发现采用率是之前研究的两倍以上,且AI辅助提交比例显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07412 2026-06-08 cs.SE cs.AI 新提交 76%

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

Socratic-SWE:通过轨迹衍生智能体技能实现自我进化的编码智能体

Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu

机构 * AI Data, Alibaba Group(阿里云数据) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.AI

AI总结 提出Socratic-SWE闭环自进化框架,通过将智能体历史求解轨迹蒸馏为结构化技能,生成针对性修复任务,实现编码智能体的持续自我改进。

Comments 21 pages, 5 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21347 2026-06-08 cs.AI cs.LG cs.SE 版本更新 67%

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator: LLM代理的系统级语料库追踪诊断

Akshay Manglik, Apaar Shanker, Kaustubh Deshpande, Jason Qin, Yash Maurya, Veronica Chatrath, Vijay S. Kalmath, Levi Lentz, Yuan Xue

机构 * Scale AI, Inc.

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27532 2026-06-08 cs.SE 版本更新 57%

A Longitudinal Analysis of Good First Issue Practices and Newcomer Pull Requests in Popular OSS Projects

对流行开源软件项目中良好首次问题实践和新成员拉取请求的纵向分析

Hirotatsu Hoshikawa, Hidetake Tanaka, Kazumasa Shimari, Raula Gaikovina Kula, Kenichi Matsumoto

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究分析了37个流行GitHub仓库中406826个问题和1117个新成员GFI拉取请求,发现GFI标签比例在2024年后显著下降,但新成员参与度稳定,但拉取请求合并率下降,表明GFI基于的入职机制需持续维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15202 2026-06-08 cs.DC cs.OS 版本更新 50%

Simple is Better: Multiplication May Be All You Need for LLM Request Scheduling

简单即最佳:乘法可能就是LLM请求调度所需的一切

Dingyan Zhang, Jinbo Han, Kaixi Zhang, Xingda Wei, Sijie Shen, Chenguang Fang, Wenyuan Yu, Jingren Zhou, Rong Chen

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出通过简单乘法结合KVCache和负载均衡指标,实现LLM请求调度的双重目标,无需超参数调优,实验显示在真实工作负载中显著提升性能。

Comments To appear in the Proceedings of 20th USENIX Symposium on Operating Systems Design and Implementation (OSDI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2605.08717 2026-06-08 cs.SE cs.AI 版本更新 62%

Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents

调试调试器:面向软件工程智能体的失败锚定结构化恢复

Chenyu Zhao, Shenglin Zhang, Yihang Lin, Wenwei Gu, Zhimin Chen, Yongqian Sun, Dan Pei, Chetan Bansal, Saravan Rajmohan, Minghua Ma

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Microsoft(微软)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出PROBE框架,通过遥测层、诊断层和指导门将运行时证据转化为结构化恢复指导,在代码修复、工作流恢复等场景中诊断准确率65.37%,恢复率21.79%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2506.11066 2026-06-08 cs.SE cs.AI 版本更新 62%

CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval

CoQuIR:面向代码质量感知信息检索的综合基准

Jiahui Geng, Fengyu Cai, Shaobo Cui, Qing Li, Liangwei Chen, Chenyang Lyu, Haonan Li, Derui Zhu, Walter Pretschner, Heinz Koeppl, Fakhri Karray

机构 * Linköping University(林波伊大学) MBZUAI(麦肯锡人工智能研究院) TU Darmstadt(德累斯顿技术大学) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院) University of Groningen(Groningen大学) Google Tokyo(东京Google) Alibaba Group(阿里巴巴集团) TU Munich(慕尼黑技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出首个大规模多语言代码质量感知检索基准CoQuIR,涵盖正确性、效率、安全性和可维护性四维度,通过细粒度标注和两个质量中心指标评估23个模型,发现顶尖模型常无法区分有缺陷代码,并探索了训练方法以提升质量感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 57%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2606.07342 2026-06-08 cs.CL cs.NE 新提交 57%

LLM-Guided Evolution for Medical Decision Pipelines

LLM引导的医疗决策流程进化

Ivan Sviridov, Artem Oskin, Ivan Panin, Iaroslav Bespalov, Dmitry Dylov, Ivan Oseledets, Aleksandr Nesterov

机构 * Sber AI Lab(Sber AI实验室) AIRI

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 提出LLM引导的MAP-Elites进化方法,无需微调即可优化医疗决策流程,在分诊、咨询和图像分类任务中超越手工设计基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06786 2026-06-08 cs.LG cs.NI 新提交 57%

Federated Foundation Models over Vehicular Networks

车辆网络中的联邦基础模型

Kasra Borazjani, Fardis Nadimi, Payam Abdisarabshali, Owen Palinski, Allan Salihovic, Dinh Nguyen, Minghui Liwang, Seyyedali Hosseinalipour

机构 * University of Waterloo(多伦多大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文提出将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,结合基础模型的表达力与联邦学习的隐私保护分布式学习能力,并通过Waymo数据集案例验证其潜力。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06711 2026-06-08 physics.ins-det 新提交 50%

Lightfall: An API-first, LLM-addressable control platform for synchrotron beamlines

Lightfall: 一种面向同步辐射光束线的API优先、LLM可寻址控制平台

Ronald J. Pandolfi, Damian Guenzing, Marcus M. Noack, Sophie A. Morley, Damon English

专题命中 仓库级理解 :repository(abstract)

AI总结 针对同步辐射光束线控制界面定制化需求,提出Lightfall平台,采用API优先架构,通过统一可寻址接口暴露所有面板、设备和扫描计划,并嵌入语言模型代理驱动实验,支持自然语言修改界面,降低定制成本。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏