EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment
EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型
机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) ; Shanghai Jiao Tong University(上海交通大学) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。