Direct Visual Grounding by Directing Attention of Visual Tokens
通过引导视觉令牌注意力实现直接视觉 grounding
机构 * Temple University(特拉华大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);vision language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。