arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1074 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1074 篇

2606.28436 2026-06-30 cs.SE cs.AI 84%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 84%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05570 2026-06-05 cs.CL cs.AI 84%

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

TensorBench: 在基于编译器的张量框架上对编码智能体进行基准测试

Bobby Yan, Fredrik Kjolstad

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 TensorBench,一个包含199个特征添加和重构任务的基准测试,用于评估编码智能体在基于编译器的张量框架上的表现,并通过测试套件自动评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20049 2026-05-20 cs.SE cs.AI 84%

Does Code Cleanliness Affect Coding Agents? A Controlled Minimal-Pair Study

代码整洁性影响编码代理吗?一项受控的最小对研究

Priyansh Trivedi, Olivier Schmitt

机构 * SonarSource

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨了代码整洁性对编码代理性能的影响,通过构建结构和风格相似但整洁度不同的代码库对,发现整洁性不影响通过率,但显著降低计算成本和文件重复访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15315 2026-05-18 cs.AI cs.CL 84%

Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning

通过多标准潜在推理进行编码代理的上下文剪枝

Jingjing Wang, Xiwen Chen, Wenhui Zhu, Huayu Li, Zhengxiao He, Feiyang Cai, Ana S. Carreon-Rascon, Xuanzhao Dong, Feng Luo

机构 * Clemson University(克莱姆森大学) Morgan Stanley(摩根大通) Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LaMR框架,通过分解代码相关性为语义证据和依赖支持两个维度,利用多任务CRF模型提升编码代理的上下文剪枝效果,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13357 2026-05-14 cs.SE cs.AI 84%

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

AIHarness工程:一种用于基础模型软件代理的运行时基质

Hailin Zhong, Shengxin Zhu

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijin Normal University(北京师范大学)

专题命中 软件智能体 :software agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出AIHarness工程,通过运行时基质提升软件代理的工程能力,定义了十一项核心职责,并提出四层 ladder 框架和基于追踪的评估协议,以验证模型-基质-环境系统生成可验证、可归因和可维护的变更。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04979 2026-04-08 cs.SE cs.AI 84%

Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

Squeez:面向编码代理的任务条件工具输出剪枝

Ádám Kovács

机构 * KR Labs(KR实验室)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了编码代理的任务条件工具输出剪枝,通过构建11477个示例的基准测试集,利用Qwen 3.5 2B模型实现92%的输入token剪枝,达到0.86召回率和0.80 F1分数,优于零样本模型和启发式基线。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03035 2026-04-06 cs.SE cs.AI 84%

Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution

超越孤立任务:一个评估编码代理在连续软件演进中的框架

KN Ajay Shastry, Ganesh Senrayan, Shrey Satapara, Pranoy Panda, Chaitanya Devaguptapu

机构 * Fujitsu Research(富士通研究所)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一个框架,通过模拟真实开发者工作流程的两个现实场景,评估编码代理在连续任务中的表现,揭示孤立任务评估的局限性及多维评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20404 2026-03-31 cs.SE cs.AI cs.ET cs.HC 84%

On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents

关于AGENTS.md文件对AI编码代理效率的影响

Jai Lal Lulla, Seyedmoein Mohsenimofidi, Matthias Galster, Jie M. Zhang, Sebastian Baltes, Christoph Treude

机构 * Singapore Management University(新加坡管理大学) Heidelberg University(海德堡大学) University of Bamberg(班贝格大学) King's College London(伦敦国王学院)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 研究AGENTS.md文件对AI编码代理在GitHub拉取请求上的运行效率和令牌消耗的影响,发现其能降低运行时间及令牌消耗,同时保持任务完成行为。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26664 2026-03-30 cs.SE cs.CL 84%

Learning to Commit: Generating Organic Pull Requests via Online Repository Memory

学习承诺:通过在线仓库记忆生成有机的拉取请求

Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09289 2025-06-12 cs.SE cs.CL 84%

UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench

Boxi Yu, Yuxuan Zhu, Pinjia He, Daniel Kang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09117 2024-10-15 cs.SE cs.AI 84%

REDO: Execution-Free Runtime Error Detection for COding Agents

Shou Li, Andrey Kan, Laurent Callot, Bhavana Bhasker, Muhammad Shihab Rashid, Timothy B Esler

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

Comments 27 pages, 13 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 83%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08793 2026-08-11 cs.CL 新提交 83%

Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents

面向异构编码智能体的技能的证据校准运行时重构

Xueping Gao

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL

AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。

Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 83%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 83%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00808 2026-08-04 cs.SE 新提交 83%

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

将交互历史转化为执行状态:面向长程编码智能体的运行时层

Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究针对长程编码智能体易受过时状态干扰的问题,提出Ledger运行时层,通过显式执行状态提升编码任务性能并降低成本,效果在多个模型和基准上得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28815 2026-08-03 cs.SE 新提交 83%

Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer

通过证据条件执行层防止编码智能体的过早提交

Yisen Xu, Chenglin Li, Zehao Wang, Jinqiu Yang, Tse-Hsun Chen

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 ECLoop是介于编码智能体与仓库间的证据条件执行层,可防止过早提交,在SWE-bench Verified上提升Pass@1指标4.8-11.8个百分点,同时降低平均token消耗。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15828 2026-07-31 cs.SE 版本更新 83%

Configuration Smells in AGENTS.md Files: Common Mistakes in Configuring Coding Agents

AGENTS.md 文件中的配置异味:配置编码代理的常见错误

Helio Victor F. dos Santos, Vitor Costa, Joao Eduardo Montandon, Luciana Lourdes Silva, Marco Tulio Valente

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文首次系统化编码代理配置文件(AGENTS.md/CLAUDE.md)的异味,通过灰文献综述和仓库挖掘识别出六种异味,并在100个开源仓库中验证其普遍性,其中Lint Leakage最常见(62%)。

Journal ref 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26937 2026-07-30 cs.SE 新提交 83%

VITAL-RAG: Invariance Race for Context Allocation in Coding Agents

VITAL-RAG:编码智能体中上下文分配的不变性竞争

Zijian Lu, Yonghua Lu, Mingcai Chen, Yiping Zuo, Xin He, Weijun Wang, Weibei Fan

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 VITAL-RAG针对编码智能体上下文分配的不变性竞争问题,通过按规范代码对象组织证据等方法,在RepoBench等数据集上提升了代码检索性能并减少了令牌占用。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11111 2026-07-14 cs.SE 新提交 83%

Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

修复前先了解:用于软件问题解决的基于问答的仓库知识获取

Haotian Lin, Silin Chen, Xiaodong Gu, Yuling Shi, Chengxi Pan, Jiaqi Ge, Mengfan Li, Jianghong Huang, Mengchieh Chuang, Beijun Shen, Haibing Guan

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE

AI总结 研究针对基于大语言模型的编码代理解决软件问题易因仓库理解不足出错的问题,提出ACQUIRE框架,通过问答驱动在修复前获取仓库知识,经两阶段解耦知识获取与补丁生成,实验证明该框架能提升问题解决准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05677 2026-07-08 cs.SE cs.HC 新提交 83%

From Conversation to Contribution: Characterizing Coding Agent in Open-Source Software

从对话到贡献:开源软件中编码代理的特征分析

Zihan Fang, Yueke Zhang, Ningzhi Tang, Collin McMillan, Toby Jia-Jun Li, Yu Huang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 研究开源软件中开发者与人工智能编码代理聊天交互和后续开发协作的关系,通过收集大量会话及关联仓库历史等进行分析,发现小仓库AI使用多,采用后贡献者有变化,还揭示了开发者对AI代码的看法及相关担忧,为开源开发实践提供见解。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01929 2026-07-03 cs.SE 新提交 83%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 软件智能体 :repository(title,abstract);program repair(abstract);分类 cs.SE

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27416 2026-06-29 cs.MA cs.SE 新提交 83%

Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents

Glite ARF:基于验证器的并行LLM编码代理研究

Vassili Philippov, Pavel Katunin, Dmitry Andreev, Igor Ostanin, Anton Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。

Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22417 2026-06-23 cs.AI 新提交 83%

Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent

代码不是内存:编码代理中的结构化代码库索引

Ishaan Bhola, Adithyan Krishnan, Sravanth Kurmala, Mukunda NS

机构 * TransformerOptimus

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 通过消融实验和跨框架对比,研究在固定编码代理框架中增加结构化代码库索引对成本与解决率的影响,发现索引能显著提升定位和解决率且不增加成本。

Comments Code and data: https://github.com/TransformerOptimus/supercoder-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04226 2026-06-08 cs.MA cs.AI 版本更新 83%

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

SW-$A^2$-Bench: 面向智能体网络的自主软件智能体生成基准测试

Linyao Chen, Bo Huang, Qinlao Zhao, Shuai Shao, Zhi Han, Zicai Cui, Ziheng Zhang, Guangtao Zeng, Wenzheng Tang, Yikun Wang, Yuanjian Zhou, Zimian Peng, Yong Yu, Weiwen Liu, Hiroki Kobayashi, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学) Queen’s University(女王大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :software agent(title,abstract);coding agent(abstract);分类 cs.AI

AI总结 提出首个软件智能体生成基准SW-$A^2$-Bench,通过编码智能体自动将代码仓库转化为自主软件智能体,评估生成智能体的忠实性与互操作性,以扩展智能体网络规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02875 2026-06-03 cs.AI 83%

Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

交接债务:当编码代理接管被中断任务时的重新发现成本

Dipesh KC, Anjila Budathoki

机构 * Independent Researcher(独立研究者) Georgia State University(佐治亚州立大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 本文通过引入“交接债务”概念,研究编码代理在任务中断后从部分状态恢复时的重新发现成本,并提出一种接管协议来量化不同交接视图对后继代理效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18552 2026-06-03 cs.SE cs.AI cs.CL cs.LG 83%

Toward Training Superintelligent Software Agents through Self-Play SWE-RL

通过自我对弈SWE-RL训练超级智能软件代理

Yuxiang Wei, Zhiqing Sun, Emily McMilin, Jonas Gehring, David Zhang, Gabriel Synnaeve, Daniel Fried, Lingming Zhang, Sida Wang

机构 * Meta FAIR University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta TBD Lab(Meta TBD 实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出自我对弈SWE-RL(SSR)方法,通过强化学习在自对弈环境中训练单一LLM代理,使其在无需人工标注问题或测试的情况下,在真实代码库中迭代注入和修复软件缺陷,在SWE-bench基准上实现显著自我改进并超越人类数据基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03362 2026-04-23 cs.SE 83%

ABTest: Behavior-Driven Testing for AI Coding Agents

ABTest:面向AI编码代理的行为驱动测试

Wuyang Dai, Moses Openja, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出ABTest框架,通过挖掘用户报告的异常生成可执行测试用例,发现AI编码代理在真实场景中的鲁棒性差异及新故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏