VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限
机构 * PKU(北京大学) ; WHU(武汉大学) ; CASIA(中国科学院自动化研究所) ; BJTU(北京交通大学) ; CUHK(香港中文大学)
专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM
AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。