MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning
MJEPA:一种简单且可扩展的音频-视觉联合嵌入预测架构
机构 * FAIR at Meta(Meta AI研究实验室) ; New York University(纽约大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MJEPA,使用统一编码器和单一预测目标进行跨模态预测,在音频分类任务上超越先前方法,并减少视频数据需求。