Attention Grounded Enhancement for Visual Document Retrieval
基于注意力的视觉文档检索增强
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。
Comments Published as a conference paper at SIGIR 2026