Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains
Relay-Bench:评估大语言模型在多领域推理链上的表现
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。
Comments 21 pages, 7 figures