arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-08 至 2026-06-08 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2605.17548 2026-06-08 cs.SE cs.AI 版本更新 62%

Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review

重新思考AI时代的代码审查:面向代理代码审查的愿景

Hüseyin Özgür Kamalı, Erdem Tuna, Vahid Haratian, Eray Tüzün

机构 * Microsoft(微软) Ankara University(安卡拉大学) Bilkent University(比尔肯特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了在AI时代代码审查的演变,提出了一种结合专门代理和人类控制的质量闸门的AI驱动代码审查流程,旨在提升代码审查的效率和可靠性。

Comments Submitted to ACM Transactions on Software Engineering Methodology (TOSEM). A shorter version of this work has been presented at ICSE-JAWs 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新 62%

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04894 2026-06-08 cs.CR cs.AI 版本更新 57%

Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software

从黑盒LLM生成的软件中提取重复漏洞

Tomer Kordonsky, Amit LeVi, Maayan Yamin, Noam Benzimra, Avi Mendelson

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出特征-安全表(FSTab),通过黑盒攻击从前端特征预测后端漏洞,并量化模型跨程序、重述和领域的漏洞复现一致性,实验显示跨域攻击成功率高达94%。

Comments ICML 2026, Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2604.04226 2026-06-08 cs.MA cs.AI 版本更新 83%

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

SW-$A^2$-Bench: 面向智能体网络的自主软件智能体生成基准测试

Linyao Chen, Bo Huang, Qinlao Zhao, Shuai Shao, Zhi Han, Zicai Cui, Ziheng Zhang, Guangtao Zeng, Wenzheng Tang, Yikun Wang, Yuanjian Zhou, Zimian Peng, Yong Yu, Weiwen Liu, Hiroki Kobayashi, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学) Queen’s University(女王大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :software agent(title,abstract);coding agent(abstract);分类 cs.AI

AI总结 提出首个软件智能体生成基准SW-$A^2$-Bench,通过编码智能体自动将代码仓库转化为自主软件智能体,评估生成智能体的忠实性与互操作性,以扩展智能体网络规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21347 2026-06-08 cs.AI cs.LG cs.SE 版本更新 67%

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator: LLM代理的系统级语料库追踪诊断

Akshay Manglik, Apaar Shanker, Kaustubh Deshpande, Jason Qin, Yash Maurya, Veronica Chatrath, Vijay S. Kalmath, Levi Lentz, Yuan Xue

机构 * Scale AI, Inc.

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27532 2026-06-08 cs.SE 版本更新 57%

A Longitudinal Analysis of Good First Issue Practices and Newcomer Pull Requests in Popular OSS Projects

对流行开源软件项目中良好首次问题实践和新成员拉取请求的纵向分析

Hirotatsu Hoshikawa, Hidetake Tanaka, Kazumasa Shimari, Raula Gaikovina Kula, Kenichi Matsumoto

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究分析了37个流行GitHub仓库中406826个问题和1117个新成员GFI拉取请求,发现GFI标签比例在2024年后显著下降,但新成员参与度稳定,但拉取请求合并率下降,表明GFI基于的入职机制需持续维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15202 2026-06-08 cs.DC cs.OS 版本更新 50%

Simple is Better: Multiplication May Be All You Need for LLM Request Scheduling

简单即最佳:乘法可能就是LLM请求调度所需的一切

Dingyan Zhang, Jinbo Han, Kaixi Zhang, Xingda Wei, Sijie Shen, Chenguang Fang, Wenyuan Yu, Jingren Zhou, Rong Chen

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出通过简单乘法结合KVCache和负载均衡指标,实现LLM请求调度的双重目标,无需超参数调优,实验显示在真实工作负载中显著提升性能。

Comments To appear in the Proceedings of 20th USENIX Symposium on Operating Systems Design and Implementation (OSDI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2605.08717 2026-06-08 cs.SE cs.AI 版本更新 62%

Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents

调试调试器:面向软件工程智能体的失败锚定结构化恢复

Chenyu Zhao, Shenglin Zhang, Yihang Lin, Wenwei Gu, Zhimin Chen, Yongqian Sun, Dan Pei, Chetan Bansal, Saravan Rajmohan, Minghua Ma

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Microsoft(微软)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出PROBE框架,通过遥测层、诊断层和指导门将运行时证据转化为结构化恢复指导,在代码修复、工作流恢复等场景中诊断准确率65.37%,恢复率21.79%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2506.11066 2026-06-08 cs.SE cs.AI 版本更新 62%

CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval

CoQuIR:面向代码质量感知信息检索的综合基准

Jiahui Geng, Fengyu Cai, Shaobo Cui, Qing Li, Liangwei Chen, Chenyang Lyu, Haonan Li, Derui Zhu, Walter Pretschner, Heinz Koeppl, Fakhri Karray

机构 * Linköping University(林波伊大学) MBZUAI(麦肯锡人工智能研究院) TU Darmstadt(德累斯顿技术大学) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院) University of Groningen(Groningen大学) Google Tokyo(东京Google) Alibaba Group(阿里巴巴集团) TU Munich(慕尼黑技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出首个大规模多语言代码质量感知检索基准CoQuIR,涵盖正确性、效率、安全性和可维护性四维度,通过细粒度标注和两个质量中心指标评估23个模型,发现顶尖模型常无法区分有缺陷代码,并探索了训练方法以提升质量感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏