GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks
GABench:用于评估大语言模型智能体图分析任务的综合基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。