How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study
开发者如何维护和演化他们的智能体指令?一项实证研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
开发者如何维护和演化他们的智能体指令?一项实证研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。
SkillReducer: 优化LLM代理技能的令牌效率
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。
SHERLOC: 代码修复智能体的结构化诊断定位
机构 * NVIDIA(英伟达) ; Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) ; TU Darmstadt(达姆施塔特工业大学) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
专题命中 软件智能体 :repository(abstract);分类 cs.CL
AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。
立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时
机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。
Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper
门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。
Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
AgentDSE:推理增强的架构设计空间探索
机构 * Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Columbia University(哥伦比亚大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。
Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026
ENPIRE: 现实世界中智能体机器人策略的自我改进
机构 * NVIDIA(英伟达) ; CMU(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出ENPIRE框架,通过环境重置、策略执行、结果验证和迭代优化的闭环反馈,使编码智能体自主改进机器人操作策略,在灵巧操作任务上达到99%成功率。
趣味性具身机器人学习
机构 * University of California, Berkeley(加州大学伯克利分校) ; Impossible Research
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。
Comments Project page: https://playful-rats.github.io/
视觉即修复:基于多模态大语言模型的视觉软件问题修复
专题命中 软件智能体 :program repair(abstract);分类 cs.SE
AI总结 本文提出GUIRepair方法,通过多模态推理解决视觉软件问题,结合图像到代码和代码到图像的组件提升故障理解和修复验证。
Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)
DeNovoSWE:扩展长时域环境以从零生成完整仓库
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。
面向软件工具发现的LLM加速快速综述——以日志异常检测为例
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。
Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026
代理知道太多:用认证TEE密封LLM API路由器
机构 * Beihang University(北京航空航天大学) ; Renmin University of China(中国人民大学) ; Independent(独立)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 针对API路由器作为应用层中间人可窃取明文交互的问题,提出AEGIS,一种提供者透明的认证API路由器,通过硬件飞地保护数据路径,客户端验证飞地后释放明文,阻止所有恶意路由器攻击。
CoAgent: 多智能体系统的并发控制
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 针对多智能体LLM系统并发访问共享状态时的冲突问题,提出MTPO协议,通过智能体自身判断冲突并修复计划,实现可串行化执行,在保持近串行正确率的同时提升速度。
Comments 14 pages, 7 figures. Submitted to ATC 2026
数值分析的形式化:超越内核接受的智能体流水线与质量审计
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出一种编码智能体流水线,将数值分析教材形式化为Lean 4代码,并引入三维质量评估框架(语义正确性、Mathlib复用、跨文件复用),发现编译通过掩盖了不忠实的形式化模式。
递归智能体框架
机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。
神奇的科学智能体及其构建方法:用于Rietveld精修的AgentBuild
机构 * UT-Battelle, LLC(UT-Battelle有限责任公司) ; US Department of Energy (DOE)(美国能源部)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出AgentBuild框架,通过科学家编写的合同(包含评分标准、课程和知识库)自动构建科学智能体,用于X射线衍射数据的Rietveld精修,实现可复用的智能体编译而非手动调优。
SentTrack: GitHub问题仓库中情感驱动的瓶颈检测
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。
实际需求响应中的语义技术:基于信息需求的路标图
专题命中 软件智能体 :software agent(abstract);分类 cs.SE
AI总结 本文针对商业建筑激励型需求响应,通过形式化本体评估方法定义信息需求,评估现有本体(Brick、DELTA、EFOnt、CIM)的不足,并提出扩展与整合路标图以增强语义互操作性。
Comments Accepted at ACM eEnergy 2026. Not yet published/
GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击
机构 * Virginia Tech(弗吉尼亚理工学院) ; AI Sequrity Company(AI安全公司)
专题命中 软件智能体 :repository(abstract);分类 cs.AI
AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。
对流行开源软件项目中良好首次问题实践和新成员拉取请求的纵向分析
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究分析了37个流行GitHub仓库中406826个问题和1117个新成员GFI拉取请求,发现GFI标签比例在2024年后显著下降,但新成员参与度稳定,但拉取请求合并率下降,表明GFI基于的入职机制需持续维护。
SWE-InfraBench:评估语言模型在云基础设施代码上的表现
专题命中 软件智能体 :code generation(abstract);分类 cs.SE
AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。
Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle
可信赖的AI软件工程师
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。
Comments The first three authors contributed equally to this work
人机协作与软件工程工作的转型
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本文通过结构化综合分析方法,研究了生成式AI和智能体AI如何将软件工程从以人类编写代码为中心转变为以指导、验证和管理自主及半自主系统为中心,并提出了一个包含技术、认知、社会技术、治理和组织五个维度的未来工程师能力框架。
SkillHarm: 通过自动化构建实现生命周期感知的基于技能的攻
机构 * The Ohio State University(俄亥俄州立大学) ; Amazon AGI(亚马逊人工智能实验室) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 提出SkillHarm基准,通过固定载荷投毒和自我变异投毒两种攻击场景,系统评估基于技能的攻击在技能使用生命周期中的风险,并构建自动化管道AutoSkillHarm生成大规模攻击样本。
Comments Work in Progress
图书馆员万岁!面向节能多智能体软件工程系统的持久搜索子智能体
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)
专题命中 软件智能体 :repository(abstract);分类 cs.CL
AI总结 针对多智能体系统中输出令牌冗余导致的高能耗问题,提出持久搜索子智能体Librarian,通过跟踪仓库搜索历史并抑制重复探索,减少输出令牌量,在SWE-Bench Verified上实现高达25%的GPU能耗降低且不损失任务性能。
Comments 19 pages, 4 figures, 12 tables
Helicase: 不确定性引导的供应链知识图谱构建与自主多智能体大语言模型
机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出Helicase,一种基于多智能体大语言模型的自主系统,通过不确定性引导的迭代验证和知识图谱构建,解决供应链中需要多跳推理的结构化推断问题,并引入SCQA基准评估。
声明式数据服务:用于组合数据系统的结构化智能体发现
机构 * Northeastern University(东北大学) ; Brown University(布朗大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。
Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026
IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入
机构 * Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。
Comments Submitted to EMNLP 2026
利用原子技能实现代理原子研究
机构 * Department of Materials Science ; Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA ; Department of Chemical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA ; Department of Chemistry, Kookmin University, Seoul 02707, Republic of Korea ; Harvard University, Department of Chemistry ; Department of Chemistry, Massachusetts Institute of Technology, Cambridge, MA 02139, USA ; Department of Nuclear Science ; Shell Information Technology International Inc., Texas 77082, United States ; Shell International Exploration \& Production Inc., Texas 77079, United States
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出AtomisticSkills框架,通过分层分解科学工作流为技能和工具,使通用AI编码代理能够进行原子级研究,并在多个科学任务中验证其能力。
为什么代理拉请求数被合并或拒绝?一项实证研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本研究通过实证分析探讨代理拉请求数被合并或拒绝的原因,发现仅依赖合并或拒绝结果无法准确反映代理能力,需考虑审查互动过程。
Comments Accepted for publication in 23rd international conference on Mining Software Repositories (MSR 2026) : 5 pages, 3 tables, 1 figure