Small Vision-Language Models are Smart Compressors for Long Video Understanding
小视觉-语言模型是长视频理解的智能压缩器
机构 * Meta AI ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。
Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/