Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理
机构 * National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学) ; Tongji University(同济大学) ; Ruijin Hospital(瑞金医院) ; Technical University of Munich(慕尼黑工业大学) ; Zhejiang University(浙江大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。