arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 249 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 249 篇

2607.02389 2026-07-03 cs.AI cs.CR cs.SE 新提交 81%

Steerability via constraints: a substrate for scalable oversight of coding agents

通过约束实现可操控性:编码智能体可扩展监督的基础

Thomas Winninger

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。

Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01810 2026-07-03 cs.SE cs.AI 新提交 81%

Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS

解耦代码复杂度与新参与者参与度:AI编码代理在开源软件中采纳的因果研究

Weiwei Xu, Xuanning Cui, Hengzhi Ye, Minghui Zhou

机构 * School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education, China(教育部高可信软件技术重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过因果推断方法,研究AI编码代理(如Cursor和Claude Code)在开源项目中的采纳是否会导致新参与者减少,发现采纳后新参与者流入未显著下降,代码复杂度虽有增加但未影响新人参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01418 2026-07-03 cs.SE cs.AI cs.HC 新提交 81%

Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI

命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究

Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 81%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26300 2026-06-26 cs.AI cs.CL 新提交 81%

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

验证地平线:编码智能体奖励没有银弹

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mingze Li, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu Wang, Yuheng Jing, Zeyao Ma, Zeyu Cui

机构 * Qwen Team(Qwen团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。

Comments Authors are listed alphabetically by their first names

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24453 2026-06-24 cs.AI cs.CL 新提交 81%

Bayesian control for coding agents

编码智能体的贝叶斯控制

Theodore Papamarkou, Vladislav Smirnov, Viktor Mazanov, Artem Vazhentsev, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * PolyShape National Technical University of Athens(雅典国家技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24429 2026-06-24 cs.SE cs.AI 新提交 81%

Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories

检测开源中的AI编码代理:对1.8亿个仓库的多方法普查验证

Arsham Khosravani, Audris Mockus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出多层面检测框架,整合配置扫描、提交消息分析等四种方法,发现单一信号低估AI代理活动达30倍,揭示不同检测渠道捕获的代理群体几乎不重叠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 81%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19613 2026-06-19 cs.SE cs.AI 新提交 81%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03332 2026-07-07 cs.SE 新提交 80%

AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?

原子提交基准测试:编码代理能否从压缩补丁中重建提交历史?

Zhihao Lin, Mingyi Zhou, Li Li

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理从压缩补丁重建提交历史的问题,将任务形式化为有重放要求的块到提交分区,构建基准测试并评估,发现自然重建比重放检查等难,部分方法表现较好,还找出常见失败模式及改进方法。

Comments 21 pages, 6 figures, benchmark paper on coding agents and software engineering; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 79%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-12 cs.SE 新提交 79%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 79%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07147 2026-08-10 cs.AI 新提交 79%

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:用于编码智能体训练的差异内差异策略优化

Xucong Wang, Zhe Zhao, Liheng Yu, Di Wu, Xiaofeng Cao, Pengkun Wang

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Stanford University(斯坦福大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Tongji University(同济大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。

Comments 16 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 79%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02670 2026-08-05 cs.CR cs.AI 新提交 79%

Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments

权限受限:强化环境下编码智能体的策略分级评估

Dotan Davidovich, Yair Amar, Hai Rozencwajg, Or Hiltch

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究针对强化环境下编码智能体的性能评估问题,在 Terminal-Bench 2.1 上评估 12 个智能体,发现策略强化会导致性能损失且模型选择依赖策略,并发布 Boundary-Bench 插件支持相关评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 79%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00947 2026-08-04 cs.SE 新提交 79%

Claim Plane: Reliability Gains and the Limits of Selective Concurrency for Parallel Coding Agents: A 30-Pair, Three-Seed Confirmatory Study of Deterministic Pre-Write Admission

声明平面:并行编码智能体选择性并发的可靠性提升与局限——确定性预写准入的30对、3种子验证性研究

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究提出声明平面机制,通过30对、3种子的验证性实验,发现其可提升并行编码智能体的可靠性,但静态准入会过度串行化执行,动态准入则存在范围覆盖问题,未实现有效并行加速。

Comments 10 pages, 4 figures, 6 main-text tables. Confirmatory follow-up to arXiv:2607.21909. Code: https://github.com/SkeinRank/claim-plane. Data and artifacts: https://huggingface.co/datasets/skeinrank/claim-plane-confirmatory-30x3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00122 2026-08-04 cs.AI 新提交 79%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29658 2026-08-03 cs.SE 新提交 79%

Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents

通过分层轨迹抽象复用编码智能体的过往修复工作

Yisen Xu, Jiayuan Zhou, Ruiqi Pan, Tse-Hsun Chen

专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE

AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28928 2026-08-03 cs.SE 新提交 79%

Automated Testing and Repair for Verified Compilers Generated by a Coding Agent

基于编码智能体生成的验证编译器的自动化测试与修复

Martin Rinard

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26375 2026-07-30 cs.CL cs.HC 新提交 79%

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

(非)配对编程:编码智能体提升生产力但损害理解能力

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 79%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25619 2026-07-29 cs.SE cs.CR 新提交 79%

SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents

SkillGate:编码代理中经济高效的运行时恶意技能文件检测

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22585 2026-07-28 cs.AI 新提交 79%

The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation

编码智能体中的支架效应:在编码智能体评估中利用选择作为隐藏变量

Naman Vats, Oleg Golev

机构 * Alibaba(阿里巴巴) Agentic AI Foundation(Agentic人工智能基金会) OpenCode Contributors(OpenCode贡献者团队) Harbor Framework Team(Harbor框架团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码智能体评估中工具选择对结果的影响,通过在三个开源工具上评估两个模型,发现工具选择会使解决任务的令牌数有40倍差异,失败指纹有工具级偏差,建议按通过率选工具-模型对并报告相关指标,还发布了相关数据和脚本。

Comments 7 pages, 2 figures, 6 tables. Preliminary work; under review at the 5th DL4C Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21909 2026-07-27 cs.SE 新提交 79%

Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents

声明平面:并行编码代理的可执行变更意图和动态范围

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。

Comments 10 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15143 2026-07-17 cs.CR cs.HC cs.SE 新提交 79%

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

设置完成,现在你已被攻破:利用设置指令攻击人工智能编码代理

Aadesh Bagmar, Pushkar Saraf

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究人工智能编码代理在安装包时因不验证依赖项而面临的供应链攻击,通过编辑项目设置文档即可发动攻击。对前沿模型在多场景下测试,发现安装安全性取决于工具与模型组合,还存在多种检测问题,提出预安装检查可弥补大部分安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13085 2026-07-16 cs.CR cs.AI 新提交 79%

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

架构之前的基线:评估用于自主渗透测试的编码代理

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

机构 * Kroda Labs(Kroda实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对自主渗透测试,以默认编码CLI代理为基线,在XBOW基准上用不同模型运行,比较不同框架结果及模型扩展效果,发现专业框架有提升,普通代理也能解决不少问题,新模型可提升同一框架,强调未来评估应报告模型匹配的普通代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交 79%

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏