DAVSS: Distilled Audio-Visual State Space Models
DAVSS:蒸馏视听状态空间模型
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS
AI总结 本研究提出14M参数的DAVSS模型,通过小patch提升输入分辨率、30%参数用于联合建模,在体积远小于CAV-MAE等Transformer视听模型的同时,性能仍优于后者。