CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
CentaurEval: 评估人机协同在编程中的价值
机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) ; Nanyang Technological University(南洋理工大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学) ; Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE
AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。
Comments Accepted by ICML 2026