SNIFR : Boosting Fine-Grained Child Harmful Content Detection Through Audio-Visual Alignment with Cascaded Cross-Transformer
机构 * IIIT-DelhiIndia(印度德里印度理工学院) ; V.B.S.P.UIndia(印度V.B.S.P.U) ; UPESIndia(印度UPES) ; Independent ResearcherIndia(印度独立研究者) ; Reliance AIIndia(印度Reliance AI) ; University of TartuEstonia(爱沙尼亚塔尔图大学) ; Plaksha UniversityIndia(印度Plaksha大学)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to INTERSPEECH 2025