arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

阿里通义提出ear-VAE2,高压缩音乐重建Mel误差降低19.4%

arXiv 2608.19843 cs · cs.MM · cs.SD

音乐生成模型通常先把波形压进连续潜变量,再在潜空间生成。压缩率提高后,高频容易消失,左右声道空间感变窄,相位也会出现不连续。阿里巴巴通义千问、莫纳什大学提出ear-VAE2,直接在复杂频谱上编码,并按频段分别修正幅度和相位。

在546首曲目的Song Describer Dataset上,ear-VAE2在7项重建指标中取得5项最佳点估计。Duplex-Aware Refiner将Mel Distance降低19.4%,残差输出维度比不加约束的修正器少约45%,专业音频工程师的主观评分也更高。

波形压缩没有显式频率轴

许多音频VAE直接处理一维波形。卷积网络可以学习频率模式,但内部没有一个明确位置代表低频、4kHz以上高频或左右声道相位差。模型发现某段高频需要额外修正时,缺少可直接控制的频带接口。

团队在相同参数预算下比较5种输入表示。复杂短时傅里叶变换同时保留每个频率格点的幅度和相位,在全频段和高频谱距离上表现最好,因此成为ear-VAE2的基础。

不同潜变量对音乐频率信息的保留情况

频率探针用于检查压缩表示是否保留低频、中频和高频结构。

复杂频谱并不等于最终音质自动更好。编码器、激活函数、声道交互和解码后修正仍需共同训练,否则相位误差会在还原波形时转成可听伪影。

每个频率格点学习不同周期响应

ear-VAE2使用Spec-SnakeBeta激活。它为不同频率位置设置带有频率相关初始化的周期函数,让网络不必用同一组非线性同时适应低频节奏、高频泛音和瞬态。

论文比较多种激活后发现,这种按频率初始化的方案优于其他变体,参数量还少于每个位置完全独立的版本。它在表达能力与参数共享之间保留了中间档位。

ear-VAE2以复数频谱编码,并在解码后按频段修正

架构同时处理左右声道的复数频谱,Duplex-Aware Refiner位于主解码器之后。

主干加入跨声道交互,使左右声道不被当成两条互不相关的单声道。立体声定位依赖两耳间时间差与强度差,分别处理容易让声像向中央塌缩。

低频修相位,高频修幅度

Duplex-Aware Refiner借鉴双耳定位规律:低频段主要修相位,中频同时修幅度与相位,高频更侧重幅度。与让一个大模块对所有频段输出任意残差相比,这种结构减少了不必要自由度。

按频段约束的修正器与无约束版本对比

修正器根据频率范围选择幅度、相位或两者共同调整。

实验中,受约束修正器把Mel Distance降低19.4%,残差输出维度减少约45%,同时改善谱距离和空间线索误差。专业工程师评分更高,为自动指标之外提供了听感证据。

主观实验规模、监听设备和曲风构成仍会影响结果。19.4%来自特定对照设置,不能解释为所有音乐在任意码率下都提升相同比例。

应用与下一步:先改善压缩底座,再看生成上限

论文还将ear-VAE2潜变量接入下游生成器,12项自动指标的点估计都优于对照。更好的自动编码器能减少生成模型需要补偿的高频和声道损失,让潜空间更适合音乐结构建模。

不同输入表示对应的频谱结构对比

频谱图展示波形、幅相和复数表示对音乐细节的不同保留方式。

下一步应测试更多语言、录音年代、现场音乐和极端动态范围,并报告不同压缩率下的码率—质量曲线。消费端还需要测量解码速度和移动设备功耗。

ear-VAE2解决的是音乐生成链路中的表示与重建问题,不代表完整生成模型已经作为产品发布。真正影响听感的还包括上游生成器、采样策略、母带处理和输出格式。

实际部署还要明确潜变量帧率、实时系数和不同采样率下的资源占用。音乐平台若要处理数分钟立体声内容,编码与解码的峰值显存、长音频边界是否出现接缝,都比单个短片段指标更直接。开源权重和统一试听样本也能帮助第三方复核工程师评分。

参考资料

https://arxiv.org/abs/2608.19843