DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents
DualGauge: 对仅由LLM和编码代理生成的规范代码进行自动化联合安全-功能基准测试
机构 * University at Buffalo, SUNY(布法罗大学)
专题命中 代码生成 :code generation(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 提出DualGauge框架,首个自动化联合评估规范代码正确性与安全性的系统,通过307个任务基准测试发现功能正确性高估可靠代码生成,联合成功率低于15%,且模型因素和代理系统均无法可靠提升。