Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
鲁棒的音频视觉目标说话人提取与情感感知多注册融合
Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li
机构
*
School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国)
;
School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国)
;
School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国)
;
Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国)
;
AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)