GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models
GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解
机构 * Fudan University(复旦大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。