When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
当规范出现时:长期远 horizon 编码代理中忠实度损失的基准测试
机构 * Purdue University(普渡大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文提出一个基准测试,研究在逐步披露目标设计时,编码代理中忠实度损失(SLUMP)的变化,通过20篇最新ML论文和371个可验证组件评估不同平台的实现忠实度。