General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Meituan(美团)
AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。
Comments 17 pages, 9 figures