ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
ST-SimDiff:平衡时空相似性与差异以实现高效的视频理解与大语言模型
机构 * Tsinghua University(清华大学) ; Shenzhen University(深圳大学) ; Xidian University(西安电子科技大学)
AI总结 本文提出ST-SimDiff框架,通过平衡时空相似性与差异来提高视频理解效率,利用时空图和双选择策略减少计算成本并提升性能。
Comments Accepted by ICLR 2026