Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning
解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型
机构 * University of California, Santa Barbara, USA(加州大学圣芭芭拉分校) ; MIT-IBM Computing Research Lab, IBM Research, USA(麻省理工-IBM计算研究实验室,IBM研究)
AI总结 提出SpeechCombine,通过单轮30k小时语音预训练和权重组合,无需指令微调即可实现指令跟随,有效将文本LLM能力迁移至语音域。