M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试
机构 * Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; East China Normal University(华东师范大学) ; Zhejiang Provincial People’s Hospital(浙江省人民医院) ; National University of Singapore(新加坡国立大学)
AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。
Comments 39 pages, 8 figures; accepted by ICLR 2026