PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Inc.(华为公司)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。
Comments Accepted by International Journal of Computer Vision (IJCV)