Training-Free Multi-Step Inference for Target Speaker Extraction
无需训练的多步推理用于目标说话人提取
Zhenghai You, Ying Shi, Lantian Li, Dong Wang
机构
*
Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)
;
Center for Speech and Language Technologies, BNRist, Tsinghua University, China(语音与语言技术中心,北京理工大学,中国)
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准
Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi
机构
*
Tsinghua University(清华大学)
;
University College London(伦敦大学学院)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Peking University(北京大学)
;
Southwest Jiaotong University(西南交通大学)
;
Zhejiang University(浙江大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Renmin University of China(中国人民大学)
;
Southeast University(东南大学)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力
Kai Li, Kejun Gao, Xiaolin Hu
机构
*
Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京)
;
IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京)
;
Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)
机构
*
Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系)
;
Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系)
;
Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系)
;
Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)