Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
多模态自注意力网络与时间对齐用于音频-视觉情感识别
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM
AI总结 本文提出基于Transformer的多模态自注意力网络,通过时间对齐旋转位置嵌入和跨时间匹配损失,解决音频-视觉情感识别中的跨模态帧率不匹配问题,提升时间线索保留和跨模态融合效果。
Comments 5 pages, 3 figures, accepted to ICASSP 2026