LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs
LLM vs. 人类单元测试:对真实 Python 错误的故障检测
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。