arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 253 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 253 篇

2608.09802 2026-08-11 cs.CL cs.SE 新提交 62%

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 62%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04942 2026-08-06 cs.LG cond-mat.mtrl-sci cond-mat.other cs.AI physics.chem-ph 新提交 62%

CheMLFlow: An Open-Source Platform for Cheminformatics and Materials Informatics Applications

CheMLFlow:用于化学信息学与材料信息学应用的开源平台

Brendan Smith, Susana Lopez-Moreno, Eric Dolores-Cuenca, Sangil Kim, Jose L. Mendoza-Cortes, Nijamudheen Abdulrahiman

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 CheMLFlow是用于构建端到端高通量智能体工作流的开源平台,可降低科学机器学习开发的编排开销,其在多类性质预测任务上达到文献性能,还支持非分子化学数据集的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 62%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 62%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02677 2026-08-05 cs.SE cs.AI cs.MA 新提交 62%

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

当策略改变概率时:用于LLM代码审查的模块化决策

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。

Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交 62%

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 62%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19837 2026-07-23 cs.AI cs.CR cs.LG 新提交 62%

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

了解你的智能体:基于侦察的人工智能智能体渗透测试

Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17686 2026-07-21 cs.SE cs.AI 新提交 62%

Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications

通过机器可读的验证与确认规范将高级需求集成到低级测试中

Mansur Arief, Nur Ahmad Khatim, Ali Akarma, Ahmad Alfan Alfian Irfan

机构 * Systems Engineering, King Fahd University of Petroleum Faculty of Computer Information Systems Islamic University of Madinah Madinah, Saudi Arabia Division of Information Science, Nara Institute of Science

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对人工智能和网络物理系统中高级需求与低级测试脱节问题,提出VNVSpec开源框架,使V&V规范机器可读可执行,能检查需求质量、链接需求与测试结果等,通过自我应用评估并可扩展用于相关测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14890 2026-07-17 cs.AI cs.SE 新提交 62%

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程

Jek Huang, Jeffery Hsia, Jiayi Sun, Freddie Shi, Wei Huang, Ian H. White

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。

Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06101 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 62%

Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Development

教学型智能体:将偶然学习重新融入人工智能辅助软件开发的设计探索

Rohit Mehra, Samdyuti Suri, Prithviraj K Tagadinamani, Kapil Singi, Vikrant Kaulgud, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, USA(Accenture,美国)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 探讨人工智能编码智能体使开发者过度依赖而失去偶然学习机会并积累知识债务的问题,提出六项设计原则,展示基于“教学型智能体”概念的“SHIELD”系统,推动形成生产力与学习互补的学习感知开发环境。

Comments 5 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05744 2026-07-08 cs.CR cs.AI cs.SE 新提交 62%

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

模型上下文协议中工具元数据负载的Unicode标签块隐藏:三个独立服务器实现之间的批准视图保真度差距

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究模型上下文协议中工具元数据负载隐藏问题,通过无模型无协议分析发现Unicode的TAG块可实现隐藏,构建概念验证并在不同元数据表面实现8种技术,验证其能突破客户端防御,且在三个独立服务器库中结果一致。

Comments 15 pages, 4 figures, 7 tables, 5 listings. Real-protocol proof-of-concept, 8 techniques across 3 independently developed MCP server libraries with 32 of 32 cross-library outcome cells agreeing, and 0 of 25 baseline false positives on a benign corpus. Data, harness, and fail-closed verifier released as a supplementary artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05666 2026-07-08 cs.SE cs.AI 新提交 62%

What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests

人工智能代理实际改变了什么?性能改进拉取请求中突变模式的实证分类法

Illia Dovhoshliubnyi, Nima Soroush, Ashkan Sami, Alexander Brownlee

机构 * Edinburgh Napier University(爱丁堡纳皮尔大学) University of Stirling(斯特林大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究聚焦人工智能编码代理这一黑箱,通过对33596个代理拉取请求中1254个性能相关差异块进行分类,发现主导的三类突变模式,揭示代理身份和目标策略对缩小基于搜索的软件工程操作空间有参考价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 62%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03780 2026-07-07 cs.SE cs.AI 新提交 62%

SkillFab: An Agent-Native Skill Production Platform

SkillFab:一个原生代理技能生产平台

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang

机构 * Peking University(北京大学) Huawei(华为) Northwestern Polytechnical University(西北工业大学) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。

Comments 12 pages, 7 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02703 2026-07-07 cs.SE cs.AI cs.DC cs.MA 新提交 62%

LLMoxie: Exploring Agentic AI for Scientific Software Development

LLMoxie:探索用于科学软件开发的智能AI

Landung Setiawan, Anant Mittal, Cordero Core, Anshul Tambay, Carlos Garcia Jurado Suarez, David A. C. Beck, Andrew J. Connolly, Vani Mandava

机构 * eScience Institute University of Washington(eScience研究院华盛顿大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对科学软件开发中现有AI编码代理的不足,介绍LLMoxie平台及其插件生态系统,通过实践总结多域研究软件工程师中心采用智能AI的挑战、平台设计及操作经验,提升AI编码代理能力。

Comments 9 pages, 4 figures. Accepted to ACM SIGKDD 2026 Workshop: Agentic AI for Scientific and Societal Advances (SciSoc Agents and LLMs). Describes an agentic AI platform for scientific software engineering with governed multi-cloud inference, structured multiagent workflows, and domain-aware coding support (cs.SE, cs.MA, cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01087 2026-07-07 cs.SE cs.AI 新提交 62%

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering

廉价代码,昂贵判断:可控代理软件工程案例研究

James C. Davis, Paschal C. Amusuo, Tanmay Singla, Berk Çakar, Kirsten A. Davis

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过12周案例研究,提出治理转换理论模型,解释专家工程师如何利用AI编码代理实现高速开发并保持可控性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30963 2026-07-01 cs.SE cs.AI 新提交 62%

Loc2Repair: A Framework for Evaluating the Impact of File-Level Issue Localization in Repo-Level LLM Repair

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Mohammad Nour Al Awad, Sergey Ivanov

机构 * ITMO University(ITMO大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出Loc2Repair模块化评估框架,通过解耦定位与修复,在SWE-bench Verified上验证文件级定位能一致提升修复率(44.7%→49.1%)并降低平均耗时。

Comments To appear in the Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026), Bremen, Germany, August 15--17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 62%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27122 2026-06-26 cs.PL cs.MA cs.SE 新提交 62%

Mostly Automatic Translation of Language Interpreters from C to Safe Rust

从C到安全Rust的语言解释器大部分自动翻译

Bo Wang, Brandon Paulsen, Joey Dodds, Daniel Kroening, Umang Mathur, Prateek Saxena

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.PL

AI总结 提出Reboot技术,通过特征约简和多智能体架构,将C语言解释器大部分自动翻译为安全Rust,消除内存漏洞,验证测试通过率62%-92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-06-24 cs.SE cs.AI 新提交 62%

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Sungmin Kang, Baishakhi Ray, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22447 2026-06-23 cs.AI cs.LG 新提交 62%

A Differentiable Atari VCS:A Complex, Fully Known Ground Truth for Explainable AI

可微分的Atari VCS:一个复杂且完全已知的可解释AI基准

Andreas Maier, Siming Bayer, Patrick Krauss

机构 * Pattern Recognition Lab, Friedrich-Alexander-University Erlangen-Nuremberg(模式识别实验室,弗里德里希-亚历山大-埃森纳赫大学) Mannheim Center for Neuromodulation and Neuroprosthetics, Heidelberg University(曼海姆神经调制与神经假体中心,海德堡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 为解决可解释AI缺乏真实内部机理的问题,我们重新实现了Atari 2600 VCS作为两个端到端可微分的模拟器,验证了其与原始硬件的逐位一致性,并展示了基于梯度的XAI可行性。

Comments Submission for AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19616 2026-06-19 cs.SE cs.AI cs.MA 新提交 62%

Before the Pull Request: Mining Multi-Agent Coordination

在拉取请求之前:挖掘多智能体协调

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 针对自主编码智能体在拉取请求中协调不足的问题,提出基于git的协调基板grite,通过事件日志减少重复和冲突工作,提升吞吐量,并自动恢复多种故障模式。

Comments 9 pages, 2 tables. LNCS format. Code, dataset, and mining toolkit: https://github.com/neul-labs/grite

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交 62%

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18733 2026-06-18 cs.SE cs.AI 新提交 62%

SWE-Future: Forecast-Conditioned Data Synthesis for Future-Oriented Software Engineering Agents

SWE-Future: 面向未来软件工程智能体的预测条件数据合成

Qiao Zhao, JianYing Qu, Jun Zhang, Yehua Yang, Hanwen Du, Zhongkai Sun

机构 * Baidu Inc(百度公司)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出SWE-Future方法,利用仓库历史证据预测未来任务类型(如功能实现、缺陷修复),并基于预测条件合成200个编码智能体任务,减少对历史PR回放的依赖,在80个仓库中达到58.1%的未来工作相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17099 2026-06-17 cs.SE cs.AI 新提交 62%

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

软件委托合约:衡量AI编码代理工作中的可审查性

Vincent Schmalbach

机构 * Independent Researcher(独立研究员)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。

Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13468 2026-06-12 cs.SE cs.AI 新提交 62%

Understanding the Rejection of Fixes Generated by Agentic Pull Requests -- Insights from the AIDev Dataset

理解AI代理生成的拉取请求修复被拒绝的原因——来自AIDev数据集的洞察

Mahmoud Abujadallah, Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过分析AIDev数据集,发现46.41%的AI代理(Copilot、Devin、Cursor、Claude)提出的代码修复被拒绝。本文对306个未合并的PR进行定性研究,归纳出14个拒绝原因,分为四类,并提出了改进模型引导的建议。

Comments 5 pages, 2 figures, MSR '26: Proceedings of the 23rd International Conference on Mining Software Repositories, April 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13449 2026-06-12 cs.SE cs.AI 新提交 62%

Toward Instructions-as-Code: Understanding the Impact of Instruction Files on Agentic Pull Requests

面向指令即代码:理解指令文件对智能体拉取请求的影响

Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 通过分析148个项目的15549个智能体PR,发现指令文件对合并率、代码变更量和合并工作量无一致正面影响,但成功项目指令文件更长且结构更清晰,提出“指令即代码”研究方向。

Comments 5 pages, 8 figures, 23rd International Conference on Mining Software Repositories, April 13--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏