CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模
机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) ; Stanford University(斯坦福大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。
Comments Project Page: https://microsoft.github.io/CoPE