Can We Trust Item Response Theory for AI Evaluation?
我们能信任项目反应理论进行人工智能评估吗?
机构 * Johns Hopkins University(约翰·霍普金斯大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。