VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; Moonshot AI ; Nanjing University(南京大学) ; School of Mathematical Sciences, Peking University(数学科学学院,北京大学)
专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。
Comments Project Page: https://llyx97.github.io/video_reason_bench/