Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
统一的空间时间令牌评分用于高效的视频视觉-语言模型
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Allen Institute for AI(人工智能研究所)
AI总结 本文提出STTS,一种高效的统一空间时间令牌评分方法,通过辅助损失和LLM下游梯度学习,在不依赖文本条件或令牌合并的情况下,对视频中50%的视觉令牌进行修剪,提升训练和推理效率62%,性能下降仅0.7%。