HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
HAVEN:用于统一视频理解的层次对齐多模态基准
机构 * Department of Information and Computer Sciences(信息与计算机科学系)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出HAVEN,一个用于统一视频理解的层次对齐多模态基准,旨在解决现有多模态大语言模型在复杂叙事总结和推理方面评估不足的问题,通过引入全粒度和全多模态的数据集架构,提供了一个严谨的标准测试平台。