BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Scale AI ; George Mason University(乔治·梅森大学)
AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。
Comments ACL 2026