Attention Grounded Enhancement for Visual Document Retrieval
基于注意力的视觉文档检索增强
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。
Comments Published as a conference paper at SIGIR 2026