AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
AlignVid: 文本引导图像到视频生成中语义保真度的免训练注意力缩放
Yexin Liu, Wen-Jie Shu, Zile Huang, Haoze Zheng, Yueze Wang, Jingjin Zhu, Manyuan Zhang, Ser-Nam Lim, Harry Yang
机构
*
Hong Kong University of Science(香港科学大学)
;
University of Central Florida, Orlando, FL, USA(中央佛罗里达大学)
;
Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)
;
The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)
机构
*
UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室)
;
Tencent(腾讯)
;
National University of Singapore(新加坡国立大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Waterloo(多伦多大学)
;
Shanghai Jiaotong University(上海交通大学)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
;
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)