SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios
SWE-EVO:在长周期软件演化场景中基准测试编码智能体
机构 * FPT Software AI Center(FPT软件人工智能中心) ; School of Computing and Information Systems(计算与信息系统学院) ; University of Melbourne(墨尔本大学) ; Center of AI Research(人工智能研究中心) ; VinUniversity(文大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 针对现有基准测试仅关注孤立单任务问题,提出SWE-EVO基准,包含48个需跨多文件多步骤修改的长周期任务,实验显示当前智能体在此类任务上表现显著不足。