One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
每个高度选择性帧一个标记:朝着长视频理解的极端压缩
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon Prime Video(亚马逊Prime视频)
AI总结 本文提出XComp模型,通过极端视频标记压缩提升长视频理解性能,结合标记级和帧级压缩,实现更高的压缩比和更密集的帧采样。
Comments Appear in the proceedings of NeurIPS 2025