SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images
SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影
机构 * Stanford University(斯坦福大学) ; Zhejiang University(浙江大学) ; The University of Queensland(昆士兰大学)
专题命中 视觉问答 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。
Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA