GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。