STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation
STAC:用于视频推理分割的选择性时空聚合与压缩
机构 * School of EEE, Nanyang Technological University, Singapore(新加坡南洋理工大学电气与电子工程学院) ; Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯通信研究院) ; VCIP, CS, Nankai University, Tianjin, China(中国天津南开大学计算机科学学院视觉计算与模式识别实验室) ; AAIS, Nankai University, Tianjin, China(中国天津南开大学人工智能学院) ; NKIARI, Shenzhen Futian, China(中国深圳福田国家知识创新工程研究院) ; Guizhou University, Guizhou, China(中国贵州大学) ; Fudan University, Shanghai, China(中国上海复旦大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 视频推理分割面临高成本问题,现有方法有局限。基于状态空间模型,STAC通过解耦的空间和时间扫描丰富特征,利用冗余进行分层压缩,在零样本流兼容设置下减少令牌、加速并超越基线。