Empowering Long-form Omni-modal Understanding with Robust Audio Perception
通过强大的音频感知增强长格式全模态理解
机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) ; Zhejiang University(浙江大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract)
AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。