Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Southeast University(东南大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。
Comments 28 pages, 10 figures, 11 tables