Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation
通过能量评分与辅助上下文表示蒸馏实现一步文本到音频生成
机构 * National Taiwan University(国立台湾大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出了一种结合能量距离训练和表示层蒸馏的一步采样框架,有效提升了文本到音频生成的速度与质量,在AudioCaps基准上优于现有方法,达到与多步采样扩散模型相当的性能。