AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
AVRT:通过单模态教师模型实现音频-视觉推理迁移
机构 * University of Tübingen, Germany(图宾根大学) ; MIT, Cambridge MA, USA(麻省理工学院) ; IBM Research, USA(IBM研究院) ; MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) ; Tuebingen AI Center, Germany(图宾根人工智能中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。