Benchmarking Visual State Tracking in Multimodal Video Understanding
多模态视频理解中的视觉状态追踪基准测试
机构 * New York University(纽约大学) ; KAIST(韩国科学技术院)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。
Comments Website: https://vision-x-nyu.github.io/vstat-site/