SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; De Artificial Intelligence Lab(德人工智能实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。
Comments 12 pages, 4 figures, 6 tables