KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
KARL:面向知识密集型视觉定位的知识感知推理与强化学习
机构 * University of Macau(澳门大学) ; Shandong University(山东大学) ; Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。