WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
WAND: 窗口注意力与知识蒸馏用于高效自回归文本到语音模型
机构 * Korea Advanced Institute of Science and Technology, Republic of Korea(韩国科学技术院) ; Sungkyunkwan University, Republic of Korea(成均馆大学)
AI总结 提出WAND框架,通过分离注意力为全局持久注意力和局部滑动窗口注意力,结合课程学习与知识蒸馏,在保持合成质量的同时将AR-TTS模型的计算和内存复杂度降至常数,KV缓存减少66.2%。
Comments Accepted at Interspeech 2026