Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA
Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型
机构 * Inference Matter Labs(推理物质实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);omni-modal(abstract);分类 cs.CV、cs.MM
AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。
Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio