AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Queen's University(女王大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
机构 * Columbia University(哥伦比亚大学)
专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE、cs.AI、cs.LG
专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.CL、cs.AI、cs.LG
自主问题解决者:迈向零接触代码维护
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 软件智能体 :code generation(abstract);program repair(abstract);repository(abstract);coding agent(abstract)
AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。
Comments 21 pages, 4 figures
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 软件智能体 :repository(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables
AI编码智能体研究中缺失了人类
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。
Comments 15 pages, 10 figures
孟德尔哥德尔机:基于比较进化的递归自改进编码智能体
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对现有自改进编码智能体仅利用单轨迹的缺陷,提出孟德尔哥德尔机,新增反应规范突变与跨谱系杂交两种自修改策略,经理论证明与实验验证,其在编码任务上的性能、效率及泛化性均优于基线方法。
Comments Project Page at https://reallcz.github.io/MGM; Code at https://github.com/RealLcz/MGM
通过代码代理进行 Bootstrap:规范即程序
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG
AI总结 研究通过代码代理实现自我提升,基于规范重新实现程序,体现元循环属性,强调规范的重要性。
Comments To appear in IEEE Software
Journal ref IEEE Software, 2026
为编码智能体学习全局可复用技能
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。
AgentArmor:编码代理失败的框架、评估与缓解
机构 * Anthropic Fellows Program(Anthropic Fellow 项目) ; Constellation
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG
AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。
Active-SWE:针对无问题报告的主动漏洞修复任务的编码智能体基准测试
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 Active-SWE是首个针对无问题报告的主动多漏洞修复任务的编码智能体基准,实验显示现有顶尖编码智能体在该任务上性能有限。
Comments 24 pages, 17 figures
编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。
Comments 24 pages, 4 figures
面向仓库级代码问答的深度智能体搜索:一项实证研究
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI
AI总结 该研究在SWE-QA基准上对比语义搜索与深度智能体搜索的代码问答效果,发现语义搜索正确率更高、成本更低,深度智能体搜索存在交接环节的新失败问题。
Comments 41 pages, 21 figures, 6 tables. Under review at a journal
SWE-NFI:面向非功能改进的编码智能体研究与基准测试
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文提出SWE-NFI基准,基于开源Python项目的真实合并拉取请求构建188个任务,评估编码智能体的非功能改进能力,发现智能体在该能力上普遍落后于人类开发者。
用于Tokenmaxxing的最佳编程语言:跨编程语言的编码代理行为研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL
AI总结 研究跨Python、Java、Rust和OCaml的编码代理行为,通过评估五个模型发现不同语言的令牌消耗有显著差异。分析代理轨迹结构与内容,揭示其在不熟悉语言中的行为特点,指出按语言的令牌效率对多语言代理基准测试和开发有指导意义。
软件工程流水线中编码代理的基于执行的安全测试
机构 * Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学) ; Hainan University(海南大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究针对软件工程流水线中编码代理的安全问题,提出基于执行的红队测试框架,利用沙盒证据探测安全边界,将不安全操作嵌入工作负载并借助执行预言机优化,通过实验大幅增加不安全执行验证率,凸显编码代理需更强安全测试。
Comments Preprint. 12 pages, 6 figures
人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究
机构 * Polytechnique Montréal(蒙特利尔大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG
AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。
传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。
IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试
机构 * Concordia University(康科德大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。
Comments 10 pages, 4 figures, 4 tables
使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器
机构 * Innopolis University(因诺波利斯大学) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。
作为编码智能体基础模型中间训练的函数感知中间填充
机构 * University of Waterloo(滑铁卢大学) ; University of British Columbia(英属哥伦比亚大学) ; NVIDIA(英伟达公司) ; Verdent AI(Verdent人工智能公司) ; Vector Institute(向量研究所)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。
MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准
机构 * Tsinghua University(清华大学)
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI
AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。
验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。
企业编码代理的推理经济学:云与本地大语言模型的案例研究
机构 * PEGAVERSE Pegatron Corporation(PEGAVERSE 联合科技公司)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究企业编码代理中云与本地大语言模型的权衡,通过案例研究对比两者,发现提示缓存可大幅降低API成本,本地配置缺陷修复负担高,不同场景下各有成本优劣,混合路由网关在成本与质量间有平衡表现。
Comments 20 pages, 13 figures, 14 tables. Industrial longitudinal case study
GameEngineBench:在真实C++运行时环境中评估编码智能体
机构 * Nitrode ; Nexon Intelligence Labs ; Dartmouth University(达特茅斯大学) ; Columbia University(哥伦比亚大学) ; Cornell University(康奈尔大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL
AI总结 研究利用GameEngineBench在虚幻引擎5项目中评估编码智能体,核心方法是构建来自九个真实游戏仓库的基准测试集,主要贡献是揭示智能体在实时交互软件的C++开发中面临挑战,凸显游戏引擎基准测试的价值。
使用编码智能体的主动流动控制启发式学习
机构 * Mines Paris - PSL University Centre for Material Forming (CEMEF) CNRS(巴黎矿业 - 巴黎文理研究大学材料成型中心(CEMEF)法国国家科学研究中心)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG
AI总结 研究主动流动控制中控制器设计难题,提出用编码智能体直接搜索显式可执行反馈律的启发式学习范式及受限协议,经多基准评估,其启发式控制器性能优、可解释,是传统强化学习的可靠互补替代方案。
失败作为一个过程:CLI编码代理轨迹剖析
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。
Comments 12 pages, 6 figures