DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers
DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试
机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。