Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods
学术文本到音乐大奖赛:数据集、基线和评估方法
机构 * Artificial Intelligence Center of Research Excellence, National Taiwan University, Taipei, Taiwan(台湾大学人工智能研究中心) ; Department of Performing Arts Technology, University of Michigan, Ann Arbor, MI, United States(密歇根大学表演艺术技术系)
AI总结 本文介绍了ICME 2026学术文本到音乐生成大奖赛(ATTM)的概述和技术框架。尽管文本到音乐生成(TTM)系统取得了快速进展,但该领域目前主要由在大规模专有数据集上训练的模型主导,这些模型使用工业级计算资源,给学术研究带来了显著障碍。为此,ATTM挑战赛建立了一个公平的基准,要求参赛者使用标准化的、采用CC许可的MTG-Jamendo数据集子集(仅包含纯音乐)从头开始训练生成模型。该挑战分为两个赛道:效率赛道(限制在5亿参数以内)和性能赛道(无参数限制)。提交将通过多阶段评估过程进行评估,包括客观指标,如Fréchet音频距离、CLAP分数和新的概念覆盖分数(CCS),随后进行主观听觉测试。通过提供开源基线、预处理管道、参考标题和公开计算FAD和CLAP的评估代码,该挑战旨在促进学术环境中的TTM研究。
Comments Accepted to IEEE ICME 2026 Grand Challenge Paper. v2: Updated Table II to report A100-equivalent GPU hours instead of raw self-reported values for a normalized and fair compute comparison