MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
MedMO:为医学图像构建和理解多模态大语言模型
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 MedMO是一种基于通用MLLM架构构建的医学多模态基础模型,通过多阶段训练提升跨模态和任务的性能,超越现有开源基线,在医学图像识别和报告生成中取得显著提升。
Comments 21 pages, 6 figures and 4 tables