PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation
PeruMedQA:在秘鲁医学考试上评估大语言模型(LLMs)——数据集构建与评估
机构 * Hubert Department of Global Health, Rollins School of Public Health, Emory University(霍伯特全球健康部门,埃默里大学公共卫生学院) ; Emory Global Diabetes Research Center of Woodruff Health Sciences Center, Emory University(埃默里大学伍德鲁夫健康科学中心全球糖尿病研究中心) ; Institut de Recherche en Informatique de Toulouse(图卢兹信息研究院) ; Universidad Nacional de Educación a Distancia(远程教育国立大学) ; Instituto de Investigación Científica, Universidad de Lima(科学研究所,利马大学) ; Barcelona Supercomputing Center(巴塞罗那超级计算中心)
专题命中 医学数据与评测 :medical AI(abstract);radiology(abstract);分类 cs.LG
AI总结 本文构建了包含8380道题的秘鲁医学考试数据集,通过微调大语言模型并对比不同模型的准确率,揭示了在西班牙语国家医学问题上的性能差异。