E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios
E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试
机构 * Hunyuan Team, Tencent(腾讯混元团队) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。
Comments 29 pages, 14 figures, 6 tables