VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
VITAL: 视觉-语义双重监督增强可解释的医学多模态大语言模型潜在推理
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tencent(腾讯) ; Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) ; Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出VITAL框架,通过视觉-语义双重监督(文本解码器重构推理链、视觉投影器回归ROI特征)实现医学MLLM的可解释潜在推理,在7个基准上达到SOTA。