Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence
波兰医学视觉问答:视觉语言模型未充分利用视觉证据
机构 * ARAAI Poland(波兰ARAAI) ; NASK National Research Institute(NASK国家研究院) ; Poznań University of Medical Sciences(波兹南医科大学) ; T. Marciniak Lower Silesian Specialist Hospital(T.马尔奇尼亚克下西里西亚专科医院) ; Adam Mickiewicz University(亚当·密茨凯维奇大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);grounding(abstract);分类 cs.AI
AI总结 该研究构建了波兰医学VQA基准,评估多类视觉语言模型,发现模型未充分利用视觉证据,仅从文本或答案选项即可达到高于随机水平的准确率,仅GPT-5.6在部分子集上超人类表现。