Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models
基于视觉基础模型的注意力一致纵向医学视觉问答
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)
AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。
Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458