Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。