When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
当AI基准测试达到平台期:基准饱和的系统性研究
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan(密歇根大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。
Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)