ABTest: Behavior-Driven Testing for AI Coding Agents
ABTest:面向AI编码代理的行为驱动测试
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE
AI总结 本文提出ABTest框架,通过挖掘用户报告的异常生成可执行测试用例,发现AI编码代理在真实场景中的鲁棒性差异及新故障模式。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
ABTest:面向AI编码代理的行为驱动测试
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE
AI总结 本文提出ABTest框架,通过挖掘用户报告的异常生成可执行测试用例,发现AI编码代理在真实场景中的鲁棒性差异及新故障模式。
EvolveSignal:一种基于大语言模型的编程代理,用于发现交通信号控制策略
机构 * Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) ; School of Transportation, Southeast University(交通学院,东南大学) ; Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; Department of Civil and Environmental Engineering, Monash University(土木与环境工程系,墨尔本大学) ; Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑工程系,皇家理工学院)
专题命中 软件智能体 :coding agent(title,abstract);program synthesis(abstract);分类 cs.LG
AI总结 本文提出EvolveSignal,利用大语言模型自动发现可解释的启发式策略,通过程序合成方法优化交通信号控制,实验表明其在减少延误和停车次数方面优于传统方法。
SWE-chat:从真实用户中编码代理交互
机构 * Stanford University(斯坦福大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 SWE-chat是首个大规模真实编码代理会话数据集,包含6000个会话,揭示了编码代理在真实场景中的使用模式和失败模式,发现代理生成的代码效率低下且存在更多安全漏洞。
OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础
机构 * MLSys 2026
专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。
Comments Accepted at MLSys 2026
RExBench:代码代理能否自主实现AI研究扩展?
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) ; Boston University(波士顿大学)
专题命中 软件智能体 :coding agent(title);分类 cs.CL
AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。
Comments ACL 2026
通过组合创新和多智能体迭代搜索策略增强研究想法生成
机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)
专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI
AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。
Comments Scientometrics
对与安全相关的AI生成拉取请求的洞察
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。
Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026
迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。