MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence
MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型
机构 * University of Georgia(佐治亚大学) ; Harvard Medical School(哈佛医学院) ; Chungbuk National University(Chungbuk国立大学) ; Chungnam National University Hospital(Chungnam国立大学医院) ; National University of Singapore(新加坡国立大学) ; New York University(纽约大学) ; University of Sydney(悉尼大学) ; New Jersey Institute of Technology(新泽西理工学院)
AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。