Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
Speaker-Reasoner: 通过扩展交互轮次和推理模式实现时间戳化的说话者归属ASR
机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Shanghai Lingguang Zhaxian Technology(上海灵光乍现科技)
AI总结 本文提出Speaker-Reasoner,一种端到端的语音大语言模型,通过迭代分析音频结构和自主预测时间边界,提升了多说话人对话的转录和理解能力,尤其在处理重叠语音和复杂轮次转换方面表现优异。