CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization
CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类
机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。
Comments Accepted to CVPR 2026