OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(诺特丹大学) ; Florida State University(佛罗里达州立大学) ; Rice University(里德大学) ; NVIDIA(英伟达) ; Mayo Clinic(梅奥诊所)
专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV
AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。