COMPOSITE-Stem
COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力
机构 * PortexAI ; University of Milano-Bicocca(米兰-比科卡大学) ; University of Calgary(卡尔加里大学) ; University of Chicago(芝加哥大学) ; Inria(法国国家信息与自动化技术研究院) ; Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) ; University of Cambridge(剑桥大学) ; Independent(独立) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Dot Ingredients ; National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Edinburgh(爱丁堡大学) ; Murdoch University(墨尔本大学) ; University of Porto(波尔图大学) ; Stanford University(斯坦福大学) ; Stony Brook University(史泰津布鲁克大学)
AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。