To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection
多模态还是非多模态:通过主动模态检测的查询自适应音视频人物检索
机构 * University of Cambridge(剑桥大学) ; Queen's University Belfast(贝尔法斯特女王大学) ; University of Surrey(萨里大学) ; Cisco(思科) ; Southwest Jiaotong University(西南交通大学) ; Teesside University(泰赛德大学)
AI总结 提出一种查询自适应框架,通过跨模态分数一致性检测主动模态,在BBC Rewind语料库上达到94.2%的P@1,优于单模态和固定融合方法。
Comments INTERSPEECH 2026