Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding
关注关键要素:通过对象对齐的视觉对比解码缓解多模态大语言模型中的对象幻觉
机构 * ETH Zurich(苏黎世联邦理工学院) ; Amazon(亚马逊) ; MBZUAI(穆罕默德·本·拉什德智能科学技术研究院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出了一种通过对象对齐的视觉对比解码缓解多模态大语言模型中对象幻觉的方法,具有计算开销低且兼容性强的特点。