Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
音乐音频视觉问答需要专门的多模态设计
机构 * University of Waterloo(滑铁卢大学) ; Dartmouth College(达特茅斯学院) ; UC Irvine(加州大学尔湾分校) ; New York University(纽约大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
AI总结 本文探讨了音乐音频视觉问答任务中多模态设计的必要性,指出需专门的输入处理、空间时间架构和音乐特定建模策略以应对连续密集的音频视觉内容和复杂时间动态。
Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026). The first two authors contributed equally