arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-05 至 2026-06-05 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2606.05720 2026-06-05 cs.SE cs.AI 81%

Microskill Architecture: A Modular Skill-Driven Framework for AI-Native Code Generation

微技能架构:一种面向AI原生代码生成的模块化技能驱动框架

Mohammad Zare, Omid Abdolrahmani

机构 * Artificial Intelligence Laboratory at AriooBarzan(AriooBarzan人工智能实验室) Engineering Team, Shiraz, Iran(伊朗谢尔兹工程团队)

专题命中 代码生成 :code generation(title);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出微技能架构,通过将知识封装为原子技能胶囊并动态选择相关胶囊,解决AI代码生成中的上下文窗口管理问题,显著降低token消耗、提高编译成功率并消除架构违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06473 2026-06-05 cs.AI cs.CL 62%

MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

MLEvolve:一种用于自动化机器学习算法发现的自我进化框架

Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出MLEvolve框架,通过渐进式MCGS、回溯记忆和分层控制解决LLM智能体在长期任务中的信息隔离、无记忆搜索和缺乏分层控制问题,在MLE-Bench和数学算法优化任务上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05680 2026-06-05 cs.PL cs.AR cs.LG 62%

CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导

Mohammad Akyash, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.LG、cs.PL

AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。

Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14792 2026-06-05 cs.AI cs.SE 62%

IaC Generation with LLMs: An Error Taxonomy and A Study on Configuration Knowledge Injection

利用LLM生成IaC:错误分类法与配置知识注入研究

Roman Nekrasov, Stefano Fossati, Indika Kumara, Damian Andrew Tamburri, Willem-Jan van den Heuvel

机构 * Jheronimus Academy of Data Science(Jheronimus数据科学学院) Tilburg University(蒂尔堡大学) Eindhoven University of Technology(埃因霍温理工大学) University of Sannio(萨诺尼大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨了如何通过系统性地注入结构化配置知识来提高LLM生成正确且意图一致的基础设施即代码(IaC)能力,特别是在Terraform中,提出了新的错误分类法,并评估了多种知识注入技术。

Comments Submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20613 2026-06-05 cs.LG cs.AI cs.MA 62%

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现

Panayiotis Danassis, Naman Goel

机构 * University of Southampton(苏塞克斯大学) University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06252 2026-06-05 cs.AI 57%

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

通过测试时重建实现潜在推理的闭环

Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) Florida State University(佛罗里达州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出ReLAT方法,利用自监督测试时训练通过查询重建损失优化潜在状态,实现潜在推理的闭环,提升数学推理、知识问答和代码生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05906 2026-06-05 cs.CL 57%

ACE-SQL: Adaptive Co-Optimization via Empirical Credit Assignment for Text-to-SQL

ACE-SQL: 基于经验信用分配的自适应协同优化方法用于文本到SQL

Xiaobing Chen, Ai Jian, Eryu Guo, Zhiqi Pang

机构 * Harbin Engineering University(哈尔滨工程大学) Harbin Institute of Technology(哈尔滨工业大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 代码生成 :repository(abstract);分类 cs.CL

AI总结 提出ACE-SQL强化学习框架,通过在线列集池和经验信用分配联合优化模式检索与SQL生成,在BIRD Dev上达到65.3%的贪心执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11732 2026-06-05 cs.IR cs.CL cs.MA cs.MM 57%

AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents

AgentDisCo: 向开放深度研究代理中的解耦与协作迈进

Jiarui Jin, Zexuan Yan, Shijian Wang, Wenxiang Jiao, Yuan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :repository(abstract);分类 cs.CL

AI总结 本文提出AgentDisCo,一种解耦且协作的代理架构,将深度研究视为信息探索与利用之间的对抗优化问题。通过批评代理评估生成的草稿并优化搜索查询,生成代理检索更新结果并修订草稿,最终生成综合报告。该框架通过元优化 harness 支持手工和自动发现的设计策略,并利用强大的代码生成代理自完善。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2606.05570 2026-06-05 cs.CL cs.AI 84%

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

TensorBench: 在基于编译器的张量框架上对编码智能体进行基准测试

Bobby Yan, Fredrik Kjolstad

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 TensorBench,一个包含199个特征添加和重构任务的基准测试,用于评估编码智能体在基于编译器的张量框架上的表现,并通过测试套件自动评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05391 2026-06-05 cs.SE cs.AI 81%

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

实践中对智能体系统的人类监督:考察使用软件代理的开发者的监督工作、挑战与启发式方法

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu

机构 * Microsoft Redmond USA(微软红mond美国)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过访谈17位经验丰富的开发者,探索人类对自主软件代理的监督实践,发现四种监督工作形式(先验控制、协同规划、实时监控、事后审查),并总结监督挑战与应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26233 2026-06-05 cs.CL 74%

Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents

提问还是假设?编码代理中的不确定性意识澄清寻求

Nicholas Edwards, Sebastian Schuster

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院)

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 本研究评估了LLM代理在未指定任务中的澄清能力,提出了一种不确定性意识的多代理框架,提高了任务解决率,并展示了多代理系统在复杂任务中主动寻求信息的行为。

Comments 18 pages, 7 figures; added experiments evaluating open-weight models (Kimi K2.6), expanded related work, and included dataset validation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 62%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05548 2026-06-05 cs.SE cs.AI 62%

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

ADK Arena: 通过LLM即开发者评估智能体开发工具包

Jintao Huang, Xiaomin Li, Gaurav Mittal, Yu Hu

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出LLM-as-a-Developer方法,通过自动化流水线ADK Arena评估51个Python ADK框架,发现框架间生成成本差异达5.6倍,但无单一框架占优,且文档、源码和参数知识可相互替代。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05249 2026-06-05 cs.SE 57%

SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code

SWE-InfraBench:评估语言模型在云基础设施代码上的表现

Natalia Tarasova, Enrique Balp-Straffon, Aleksei Iancheruk, Yevhenii Sielskyi, Nikita Kozodoi, Liam H. Byrne, Jack Butler, Dayuan Jiang, Marcin Czelej, Andrew Ang, Yash Shah, Roi Blanco, Sergei Ivanov

专题命中 软件智能体 :code generation(abstract);分类 cs.SE

AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2511.14224 2026-06-05 cs.SE 79%

Knowledge Matters: Injecting Project and Testing Knowledge into LLM-based Unit Test Generation

知识很重要:将项目和测试知识注入基于大语言模型的单元测试生成

Anji Li, Mingwei Liu, Zhenxi Chen, Zheng Pei, Zike Li, Dekun Dai, Yanlin Wang, Zibin Zheng

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE

AI总结 本文提出KTester框架,通过整合项目特定知识和测试领域知识,提升基于大语言模型的单元测试生成能力,实验表明其在多个关键指标上优于现有方法,提高了测试通过率和覆盖率,且生成的测试更易读易维护。

Comments Accepted at the 48th International Conference on Software Engineering(ICSE 2026),13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2604.23190 2026-06-05 cs.SE cs.AI 62%

RAT: RunAnyThing via Fully Automated Environment Configuration

RAT: 通过完全自动化的环境配置实现RunAnyThing

Renhong Huang, Dongdong Hua, Yifei Sun, Sitao Ding, Hanyang Yuan, Daixin Wang, Yang Yang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出RAT框架,用于在任意仓库上实现跨编程语言的全自动环境配置,通过多阶段流水线整合语言感知抽象、镜像初始化、专用配置工具集和稳健沙箱,并提出RATBench基准测试集,实验表明RAT在环境设置成功率上比强基线提升了36.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05525 2026-06-05 cs.AI cs.HC 57%

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills:面向科学数据分析和可视化的智能体技能设计与评估

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺丁汉大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 提出SciVisAgentSkills技能库,通过编码环境假设、工具使用模式和领域启发式知识增强编码智能体,在ParaView等科学工具上实现自然语言驱动的科学可视化工作流,实验表明技能可提升任务得分并影响token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2606.06492 2026-06-05 cs.SE cs.AI cs.CL 67%

Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution

Code2LoRA:用于软件演化下代码语言模型的超网络生成适配器

Liliana Hotsko, Yinxi Li, Yuntian Deng, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出Code2LoRA超网络框架,通过生成仓库特定的LoRA适配器注入仓库知识,无需推理时令牌开销,支持静态和演化两种场景,在RepoPeftBench上达到与逐仓库LoRA相当或更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29054 2026-06-05 cs.SE cs.CL 62%

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

转换而非等价:通过观察等价性基准测试代码库转换

Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

机构 * University of Southern California(南加州大学) Google Cloud AI Research(谷歌云人工智能研究) University of Notre Dame(圣约翰大学) Google Deepmind(谷歌DeepMind)

专题命中 仓库级理解 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 针对代码库转换中智能体过度信任本地验证导致语义违反的问题,提出T2J-Bench基准,通过固定等价契约和三级验证(Spec、Numeric、Behavioral)评估转换质量,发现最佳系统通过率仅26.7-28.9%,且所有系统高估成功率66.6-97.8点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05629 2026-06-05 math.CO 50%

An automated proof that R(B_8,B_10)=37

R(B_8,B_10)=37 的自动化证明

Jeremy Kalfus, Bernard Lidický

专题命中 仓库级理解 :repository(abstract)

AI总结 通过AI辅助工作流AutoMath,证明了书图Ramsey数R(B_8,B_10)=37,并给出了上界的Lean形式化证明。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏