Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models
MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理
机构 * UCSB(加州大学圣塔芭芭拉分校) ; University of Washington(华盛顿大学) ; UCLA(加州大学洛杉矶分校)
专题命中 多模态生成 :MLLM(title_cn,abstract);multimodal(title,abstract);分类 cs.CL
AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。