Small Vision-Language Models are Smart Compressors for Long Video Understanding
小视觉-语言模型是长视频理解的智能压缩器
机构 * Meta AI ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。
Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/