Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions
通过动态多轮交互对视觉语言模型进行情境化评估
机构 * UC San Diego(加州大学圣地亚哥分校) ; Northeastern University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Johns Hopkins University(约翰·霍普金斯大学)
AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。