AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning
AVSCap:为全模态视频字幕编排视听协同
机构 * Nanjing University(南京大学) ; Kuaishou Technology(快手科技) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。