SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution
EvoClaw: 评估AI代理在持续软件演化中的表现
机构 * USC(美国斯克利普斯大学) ; UCR(加州大学河滨分校) ; UCSD(加州大学圣地亚哥分校) ; Army Research Office(陆军研究办公室) ; Stanford(斯坦福大学) ; Princeton(普林斯顿大学) ; Haven ; OpenHands
AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。
Comments ICML 2026