arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Scale AI

2026-04-21 至 2026-04-21 共收录 1
2602.06221 2026-04-21 cs.CL

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Scale AI George Mason University(乔治·梅森大学)

AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏