Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking
临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性
机构 * University of Luebeck(吕贝克大学) ; University of Tübingen(图宾根大学) ; University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) ; University Hospital Würzburg(维尔茨堡大学医院) ; Charité – Universitätsmedizin Berlin(柏林夏里特医学院) ; Genie Enterprise Deutschland GmbH
专题命中 医学数据与评测 :medical AI(title)
AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。