Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?
性能优化基准测试是否可靠地衡量编码智能体?
机构 * Singapore Management University(新加坡管理大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 本研究审计了三个仓库级性能优化基准(GSO、SWE-Perf、SWE-fficiency),发现参考补丁的可复现性差、评分规则导致排名不一致,且多数任务已被公开提交解决,揭示了聚合排名掩盖的性能差距。
Comments 12 pages, 7 figures. Public data: https://github.com/chenzhi-cz/performance-optimization-benchmark-reliability