One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
一条轨迹,一个标记:通过全景子对象轨迹实现的 grounded 视频标记化
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能艾伦研究所) ; Woven by Toyota, Inc(丰田公司)
AI总结 本文提出 grounded 视频标记化方法,通过全景子对象轨迹组织标记,减少冗余并保持时间一致性,TrajViT 在多个视频理解基准上优于空间-时间 ViT,具有更高的效率和性能。
Comments ICCV 2025