arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2601.21372 2026-07-21 cs.AI 版本更新 79%

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15143 2026-07-17 cs.CR cs.HC cs.SE 新提交 79%

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

设置完成,现在你已被攻破:利用设置指令攻击人工智能编码代理

Aadesh Bagmar, Pushkar Saraf

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究人工智能编码代理在安装包时因不验证依赖项而面临的供应链攻击,通过编辑项目设置文档即可发动攻击。对前沿模型在多场景下测试,发现安装安全性取决于工具与模型组合,还存在多种检测问题,提出预安装检查可弥补大部分安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13085 2026-07-16 cs.CR cs.AI 新提交 79%

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

架构之前的基线:评估用于自主渗透测试的编码代理

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

机构 * Kroda Labs(Kroda实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对自主渗透测试,以默认编码CLI代理为基线,在XBOW基准上用不同模型运行,比较不同框架结果及模型扩展效果,发现专业框架有提升,普通代理也能解决不少问题,新模型可提升同一框架,强调未来评估应报告模型匹配的普通代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交 79%

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06184 2026-07-08 cs.SE 新提交 79%

What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents

解决率背后隐藏的内容:编码代理的轨迹结构诊断

Rui Shu, Chun Yong Chong, Xin Zhou, Yun Peng, Zihan Wu, Xu Han, Zeyang Zhuang, Guowen Yuan, Yuan Wang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理解决率背后隐藏的轨迹结构问题,提出TraceProbe框架,将原始运行归一化并应用两个基于规则的模块,通过对2500个轨迹的实验,发现文件选择、函数选择等行为与结果的关系,以及反模式作用等,为结果添加诊断上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05743 2026-07-08 cs.CR cs.AI 新提交 79%

The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities

人工智能编码代理执行安全研究的巴尔干化:隔离、访问控制和检查时间到使用时间漏洞

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室) Berlin, Germany(德国柏林)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究人工智能编码代理执行安全相关文献分散问题,将39篇论文系统化分类并验证,找出五个交叉差距,如隔离架构与能力模型缺乏共享基准评估等,最后针对差距提出研究议程。

Comments 18 pages, 15 figures, 6 tables. Systematizes 39 execution-security papers (2023-2026) into 17 verified categories. Machine-readable corpus and verification script released as a supplementary artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02857 2026-07-07 cs.CR cs.SE 新提交 79%

MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents

MOSAIC:大语言模型编码代理中知识引导的命令行命令组合攻击

Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究大语言模型编码代理中CLI命令组合风险,提出知识引导框架MOSAIC,从漏洞等提取命令状态行为总结成攻击路径,实例化开发者工作流程,通过多实验得高攻击成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02807 2026-07-07 cs.AI 新提交 79%

SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery

群体研究:编排编码智能体以进行开放式发现

Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究长期运行的编码智能体存在的问题,假设两个设计选择导致该问题,介绍SwarmResearch,一种编排器-子智能体架构,在开放式优化任务中表现良好,其编排器引导扩展能发现更好方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 79%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02606 2026-07-07 cs.SE 新提交 79%

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

ChainSWE:在多漏洞软件维护中对编码代理进行基准测试

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE

AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24530 2026-07-07 cs.CL 新提交 79%

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

NatureBench: 编码智能体能达到Nature系列论文已发表SOTA水平吗?

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

机构 * Horizon Research(地平线研究) Tsinghua University(清华大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 提出跨学科基准NatureBench,包含90个来自Nature系列论文的任务,评估AI编码智能体在真实科学问题上的发现能力。最强模型仅在17.8%任务上超越SOTA,失败主因是方法选择错误和计算预算不足。

Comments Add results of GLM-5.2 and MinMax-M3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 79%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22435 2026-07-03 cs.RO cs.AI 版本更新 79%

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00038 2026-07-02 cs.SE 新提交 79%

Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting

停止手把手指导你的编码智能体:设计替代逐步提示的循环机制

Sandeco Macedo

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 79%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26289 2026-06-26 cs.SE 新提交 79%

Augmentation with Dilution: A Large-Scale Empirical Study of Human Contributor Ecosystems After AI Coding Agent Adoption

稀释式增强:AI编码代理采纳后人类贡献者生态系统的大规模实证研究

Weixing Zhang, Bowen Jiang, Anne Koziolek

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 通过双重差分法分析11,097个GitHub仓库,发现AI编码代理采纳不改变人类贡献者绝对数量,但显著降低其密度,并减少新人参与份额,同时增加审查深度,揭示“稀释式增强”模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01522 2026-06-26 cs.PL 版本更新 79%

Type-Error Ablation and AI Coding Agents

类型错误消融与AI编码代理

Shriram Krishnamurthi, Matthew Flatt

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.PL

AI总结 通过消融实验研究AI编码代理在修复类型错误时,更详细的错误消息是否比简洁消息更有效,并发现详细错误消息提升修复能力,类型系统比仅测试失败报告更有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23752 2026-06-24 cs.SE 新提交 79%

ESAA-Conversational: An Event-Sourced Memory Layer for Continuity, Handoff, and Curation Across Heterogeneous LLM Coding Agents

ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层

Elzo Brito dos Santos Filho

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。

Comments 11 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20158 2026-06-19 cs.SE 新提交 79%

N-Version Programming with Coding Agents

使用编码代理的N版本编程

Javier Ron, Benoit Baudry, Martin Monperrus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文在当代AI编码代理背景下重新审视N版本编程,通过Knight-Leveson实验评估代理系统、模型和实现语言的多样性对故障模式的影响,发现常见模式故障,但多数投票三版本单元显著降低故障数,证明该策略的工程实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19319 2026-06-18 cs.MA cs.AI cs.DB 新提交 79%

Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents

数据智能代理:通过自主编码代理解释、建模和查询企业数据

Anoushka Vyas, Aarushi Dhanuka, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 79%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13763 2026-06-15 cs.SE 新提交 79%

Do programming languages still matter to your AI coding agent teammate? Evidence at scale from chess engines

编程语言对你的AI编码队友还重要吗?来自国际象棋引擎的大规模证据

Mathieu Acher, Jean-Marc Jézéquel

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 通过让前沿AI代理用17种编程语言开发国际象棋引擎,发现AI能生成任何语言的可用系统,但语言选择仍影响性能、成本和功能,主流编译语言才能达到强棋力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13175 2026-06-12 cs.SE 新提交 79%

The End of Code Review: Coding Agents Supersede Human Inspection

代码审查的终结:编码代理取代人工审查

Martin Monperrus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文论证基于大型语言模型的编码代理已超越传统人工代码审查的能力阈值,能以更低成本、更高吞吐量实现审查目标,并指出人工审查与AI协作的路径不可持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12329 2026-06-11 cs.AI 新提交 79%

PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层

Ripon Chandra Malo, Tong Qiu

机构 * University of Utah(犹他大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出PROJECTMEM,一种本地优先、事件溯源的记忆与判断层,通过记录事件日志并生成紧凑摘要,帮助AI编码代理避免重复错误,实现记忆即治理。

Comments 12 pages, 5 figures, 1 table. Code: https://github.com/riponcm/projectmem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11447 2026-06-11 cs.CL 新提交 79%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10933 2026-06-10 cs.AI 新提交 79%

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

前沿编码代理使用元编程适应不熟悉的编程语言

Aman Sharma, Sushrut Thorat, Paras Chopra

机构 * Lossfunk

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09801 2026-06-10 cs.AI 版本更新 79%

How can we assess human-agent interactions? Case studies in software agent design

如何评估人机交互?软件代理设计案例研究

Valerie Chen, Rohit Malhotra, Xingyao Wang, Juan Michelini, Xuhui Zhou, Aditya Bharat Soni, Hoang H. Tran, Calvin Smith, Ameet Talwalkar, Graham Neubig

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.AI

AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 79%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07448 2026-06-08 cs.SE 新提交 79%

Agentic Very Much! Adoption of Coding Agent in New GitHub Projects

Agentic Very Much! 新GitHub项目中编码助手的采用

Romain Robbes, Théo Matricon, Thomas Degueule, Andre Hora, Stefano Zacchiroli

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究新创建的GitHub项目中编码助手的采用情况,发现采用率是之前研究的两倍以上,且AI辅助提交比例显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-06-02 cs.SE cs.CR 79%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏