VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。