Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention
提出并关注:通过多令牌局部注意力实现无训练的多模态大语言模型接地置信度
机构 * Amazon(亚马逊)
专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型接地置信度问题,提出无训练的多令牌局部注意力(MTLA)方法,通过在声称区域内求和并跨预测令牌聚合恢复更强接地信号,在多模型家族和模态中提升了幻觉AUROC及零样本检测AP。