SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation
SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。
Comments 14 pages, 3 figures, accepted by PRCV2026