LocAnyMed: Vision-Language Grounding for Multimodal Medical Images
LocAnyMed:面向多模态医学图像的视觉-语言定位
专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV
AI总结 该研究构建多模态医学视觉定位数据集LocAnyMed-200K及理由增强子集LocAnyMed-CoT-20K,通过微调LocateAnything-3B提升医学定位性能,为相关研究提供统一基础。
Comments Technical report; work in progress. 28 pages, 5 figures, and 16 tables. Code: https://github.com/MiliLab/LocAnyMed