Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification
先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; AT&T Chief Data Office(AT&T首席数据办公室)
专题命中 跨模态检索 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。
Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/