M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。