Time Blindness: Why Video-Language Models Can't See What Humans Can?
时间盲:为什么视频语言模型无法看到人类能看见的东西?
机构 * KAUST(卡士大学) ; VILA Lab, MBZUAI(VILA实验室,MBZUAI)
专题命中 长视频与时序推理 :video-language(title);video understanding(abstract);分类 cs.CV
AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。
Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io