Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏
机构 * University of Macau(澳门大学) ; South China University of Technology(华南理工大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。
Comments 53 pages, 14 figures, 26 tables