XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
XM-ALIGN:面向人脸-语音关联的统一跨模态嵌入对齐框架
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) ; Urumqi Branch, China Mobile Group Xinjiang Co., Ltd(中国移动新疆乌鲁木齐分公司) ; School of Intelligence Science and Technology, Xinjiang University(新疆大学智能科学与技术学院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出XM-ALIGN框架,通过显式与隐式对齐机制提升跨模态验证性能,采用共享分类器联合优化人脸与语音嵌入,并通过数据增强提升泛化能力。
Comments FAME 2026 Technical Report
Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)