V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架
机构 * Nanjing University(南京大学) ; Microsoft Research(微软研究院) ; Central South University(中南大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV
AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。