SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models
SARA: 语义自适应关系对齐用于视频扩散模型
机构 * Tencent Hunyuan(腾讯文英)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
SARA: 语义自适应关系对齐用于视频扩散模型
机构 * Tencent Hunyuan(腾讯文英)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。
FG-Attn:在视频扩散模型中利用细粒度稀疏注意力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。
WorldPlay:面向实时交互式世界建模的长期几何一致性
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV
AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。
Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay