TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。
Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2