Automated Benchmark Auditing for AI Agents and Large Language Models
AI智能体与大语言模型的自动化基准审计
机构 * Duke University(杜克大学) ; Together AI ; Stanford University(斯坦福大学)
AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。