Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
机构 * HKUST(香港科技大学) ; University of Edinburgh(爱丁堡大学) ; CUHK(香港中文大学) ; NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) ; Tsinghua University(清华大学)
AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。
Comments Work in Progress