SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis
SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架
机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; University of Liverpool(利物浦大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。
Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)