ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China
ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集
机构 * LMU Munich(慕尼黑大学) ; FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心) ; Sun Yat-sen University(中山大学) ; University of Copenhagen(哥本哈根大学) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出ChinaHeritaQA多模态基准数据集,包含2279张图像和14133个双语多项选择题,覆盖七个认知维度,评估视觉语言模型在中国世界遗产上的文化推理能力。