EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
EAR:增强单模表示以实现弱监督音频视觉视频解析
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) ; State Grid Corporation of China(国家电网公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。