Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation
超越Pass@k:衡量智能体代码生成的可靠性与安全性
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Cornell University(康奈尔大学)
专题命中 代码评测 :code generation(title);repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。