Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) ; Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) ; Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) ; System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) ; Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) ; Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) ; Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) ; School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) ; Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) ; Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。