First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法
机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。
Comments 19 pages, 13 figures