MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。
Comments ICML 2026