G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
G-STAR: 端到端全局说话人跟踪属性识别
机构 * Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。
Comments submitted to Emnlp 2026