KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答
机构 * University of Science and Technology of China(中国科学技术大学) ; Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。