MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
MatSciBench: 基准测试大型语言模型在材料科学中的推理能力
机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) ; University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) ; Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI
AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。