VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence
VISTAQA: 评估联合视觉问答与像素级证据
机构 * University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)
AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。