ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities
ELT-Bench-Verified: 评估质量问题低估了AI代理的能力
机构 * IBM Research(IBM研究院) ; ETH Zurich(苏黎世联邦理工学院) ; University of Illinois (UIUC)(伊利诺伊大学厄巴纳-香槟分校)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文通过重新评估ELT-Bench发现代理能力被低估,提出Auditor-Corrector方法修正评估质量,构建ELT-Bench-Verified提升评估准确性。