Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models
面向大语言模型复杂图推理的统一多维度基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。
Comments Under review