Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming
超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。