VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。