Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models
压力测试揭示视频-语言模型中脆弱的时间与视觉基础
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Adobe Research(Adobe研究) ; Qualtrics ; iManage ; NVIDIA ; Amazon Science(亚马逊科学) ; Capital One
专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV
AI总结 REVEAL{}通过五个压力测试揭示视频-语言模型在时间与视觉基础方面的脆弱性,展示其在处理视频内容、时间序列和运动方面的不足。