Grounding Everything in Tokens for Multimodal Large Language Models
基于令牌的多模态大语言模型的 grounding
机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) ; AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) ; Central Research Institute, Huawei(华为中央研究院)
专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。
Comments 19 pages, 16 figures, 12 Tables