arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 249 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 249 篇

2608.09072 2026-08-11 cs.SE cs.AI 新提交 90%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 软件智能体 :code generation(title,abstract);coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28591 2026-07-31 cs.SE cs.CL cs.LG 新提交 89%

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

Change2Task:从仓库变更到可执行编码智能体任务与环境

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。

Comments 15 pages, 7 figures, and 15 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24882 2026-07-29 cs.IR cs.AI cs.CL 新提交 88%

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

智能体检索基准:评估代码智能体的仓库上下文检索

Bowen Qin, Yi Xie

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 88%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09268 2026-08-11 cs.HC cs.AI 新提交 88%

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.AI

AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。

Comments 8 pages of main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02001 2026-08-04 cs.SE 新提交 88%

VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection

VulnGym:面向代码智能体的仓库级漏洞检测基准测试

Kexing Ji, Jiachen Liu, Enze Hu, Cuiyun Gao, Keke Lian, Yongheng Liu, Lei Zhang, Tian Dong, Hao Chen, Wang Bin

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究人员提出VulnGym基准,解决现有基准难以评估代码智能体仓库级漏洞检测能力的问题,发现当前代码智能体在该检测及支撑追踪构建上仍存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25431 2026-07-29 cs.SE 新提交 88%

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

CodeNib:一种用于向编码代理提供仓库上下文的多视图数据系统

Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen, Aryan Dokania, Mihir Jagtap, Jiayu Chang, Yitong Ma, Yash Jayswal, Wentao Ni, Hejia Zhang, Zhaoling Chen, Gangda Deng, Jishen Zhao

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理从仓库获取上下文的问题,提出CodeNib构建多视图数据系统,可重用视图并映射到源范围,通过运行时提供多种服务,实验表明其在更新速度、延迟等方面有优势,支持多视图仓库上下文服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14066 2026-07-01 cs.SE 新提交 88%

FastContext: Training Efficient Repository Explorer for Coding Agents

FastContext: 为编码智能体训练高效的仓库探索器

Shaoqiu Zhang, Maoquan Wang, Yuling Shi, Yuhang Wang, Xiaodong Gu, Yongqiang Yao, Tori Gong, Sheng Chen, Rao Fu, Anisha Agarwal, Spandan Grag, Gabriel Ryan, Colin Merkel, Yufan Huang, Shengyu Fu

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04804 2026-08-06 cs.SE cs.AI 新提交 87%

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

Scrouting:通过先探查仓库实现编码智能体的成本感知路由

Ishaan Bhola, Adithyan Krishnan, Mukunda NS

专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.AI

AI总结 本文提出SuperScout,先探查仓库生成经沙箱验证的结构化交接内容,再路由任务至四个修复器,在SWE-bench Pro上以约五分之一成本达到最优单模型的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 87%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :program synthesis(title,abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02499 2026-08-04 cs.SE cs.AI cs.CL 新提交 85%

SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

SWE-Touch:用户接触代码时的编码智能体基准测试

Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Touch基准测试显示,编码智能体对共享工作空间的状态感知不足,反编辑使其解决率降低7.7个百分点,需优化相关协作能力。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/SWE-Touch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 84%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04278 2026-08-06 cs.SE cs.AI 新提交 84%

EA-Graph: Artifact-Anchored Verification Memory for Coding Agents under Upstream Drift

EA-Graph:面向上游漂移场景下编码智能体的工件锚定验证记忆

Hwai-Jung Hsu, Cheng-Jan Chi, Hanna Everett

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出EA-Graph这一工件锚定验证记忆,经实验证实其在编码智能体的可证性判断任务中,能提升较小模型的表现,可缩小模型间能力差距。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27250 2026-07-31 cs.SE cs.AI 新提交 84%

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究

Prakhar Khatri

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 84%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13091 2026-07-16 cs.SE cs.AI 新提交 84%

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架

Aditya Aggarwal, Nahid Farhady Ghalaty

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。

Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09691 2026-07-14 cs.LG cs.AI 新提交 84%

What Context Does a Coding Agent Actually Need to Act?

编码智能体实际行动需要什么上下文?

Brian Sam-Bodden

机构 * Integrallis Software(Integrallis软件公司)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 研究编码智能体编辑代码时实际所需上下文,通过固定定位、改变代码表示并评分,发现代码本身自然语言摘要作用小,周围上下文无关紧要,压缩上下文效果好,还发现API推理的噪声底限,且发布相关工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22504 2026-07-08 cs.CR cs.AI cs.SE 新提交 84%

Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents

挥之不去的权限:面向编码智能体的可撤销资源与效果能力

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 针对编码智能体中临时权限残留问题,提出PORTICO监控器,通过可撤销能力生命周期管理,在保持任务成功率的同时消除越权副作用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 84%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 83%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08793 2026-08-11 cs.CL 新提交 83%

Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents

面向异构编码智能体的技能的证据校准运行时重构

Xueping Gao

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL

AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。

Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 83%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 83%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00808 2026-08-04 cs.SE 新提交 83%

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

将交互历史转化为执行状态:面向长程编码智能体的运行时层

Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究针对长程编码智能体易受过时状态干扰的问题,提出Ledger运行时层,通过显式执行状态提升编码任务性能并降低成本,效果在多个模型和基准上得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28815 2026-08-03 cs.SE 新提交 83%

Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer

通过证据条件执行层防止编码智能体的过早提交

Yisen Xu, Chenglin Li, Zehao Wang, Jinqiu Yang, Tse-Hsun Chen

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 ECLoop是介于编码智能体与仓库间的证据条件执行层,可防止过早提交,在SWE-bench Verified上提升Pass@1指标4.8-11.8个百分点,同时降低平均token消耗。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26937 2026-07-30 cs.SE 新提交 83%

VITAL-RAG: Invariance Race for Context Allocation in Coding Agents

VITAL-RAG:编码智能体中上下文分配的不变性竞争

Zijian Lu, Yonghua Lu, Mingcai Chen, Yiping Zuo, Xin He, Weijun Wang, Weibei Fan

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 VITAL-RAG针对编码智能体上下文分配的不变性竞争问题,通过按规范代码对象组织证据等方法,在RepoBench等数据集上提升了代码检索性能并减少了令牌占用。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11111 2026-07-14 cs.SE 新提交 83%

Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

修复前先了解:用于软件问题解决的基于问答的仓库知识获取

Haotian Lin, Silin Chen, Xiaodong Gu, Yuling Shi, Chengxi Pan, Jiaqi Ge, Mengfan Li, Jianghong Huang, Mengchieh Chuang, Beijun Shen, Haibing Guan

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE

AI总结 研究针对基于大语言模型的编码代理解决软件问题易因仓库理解不足出错的问题,提出ACQUIRE框架,通过问答驱动在修复前获取仓库知识,经两阶段解耦知识获取与补丁生成,实验证明该框架能提升问题解决准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05677 2026-07-08 cs.SE cs.HC 新提交 83%

From Conversation to Contribution: Characterizing Coding Agent in Open-Source Software

从对话到贡献:开源软件中编码代理的特征分析

Zihan Fang, Yueke Zhang, Ningzhi Tang, Collin McMillan, Toby Jia-Jun Li, Yu Huang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 研究开源软件中开发者与人工智能编码代理聊天交互和后续开发协作的关系,通过收集大量会话及关联仓库历史等进行分析,发现小仓库AI使用多,采用后贡献者有变化,还揭示了开发者对AI代码的看法及相关担忧,为开源开发实践提供见解。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01929 2026-07-03 cs.SE 新提交 83%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 软件智能体 :repository(title,abstract);program repair(abstract);分类 cs.SE

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏