EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
EchoPrune: 将冗余视为时间回声以实现高效的视频大语言模型
机构 * KU Leuven(鲁文大学) ; Shanghai Jiaotong University(上海交通大学) ; Weill Cornell Medicine(韦尔医学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出EchoPrune方法,通过将冗余视频token视为时间回声,提升视频大语言模型在固定token预算下的时间分辨率,实验表明其在六个视频理解基准上使模型处理20倍帧数,性能提升8.6%且推理速度提升5.6倍。
Comments 9 pages