LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation
LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程
专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL
AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。
Comments Project page: https://loopsbench.ai/