InViC: Intent-aware Visual Cues for Medical Visual Question Answering
InViC:面向医疗视觉问答的意图感知视觉线索
机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) ; Westlake University(西湖大学) ; Southern Medical University(南方医科大学)
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。
Comments 10 pages, 2 figures