YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
YOSE: 你只选择本质的标记以实现高效的DiT基于视频对象移除
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; NKIARI, Shenzhen Futian(深圳南山研究院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 YOSE通过引入BVI和DiffSim模块,实现了高效的DiT视频对象移除,通过动态选择关键标记和模拟扩散过程,使推理时间与遮挡区域线性相关,从而在70%的情况下达到2.5倍的加速,同时保持视觉质量。
Comments accepted by CVPR2026