Making Time Editable in Video Diffusion Transformers
在视频扩散Transformer中实现时间可编辑性
机构 * Kandinsky Lab(坎迪斯基实验室)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
在视频扩散Transformer中实现时间可编辑性
机构 * Kandinsky Lab(坎迪斯基实验室)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。
SARA: 语义自适应关系对齐用于视频扩散模型
机构 * Tencent Hunyuan(腾讯文英)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。
FG-Attn:在视频扩散模型中利用细粒度稀疏注意力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。
Lip Forcing: 用于实时唇部同步的少步自回归扩散
机构 * KAIST AI(韩国科学技术院人工智能) ; AIPARK
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。
Comments Project Page: https://cvlab-kaist.github.io/LipForcing/