SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision
SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。
Comments 29 pages, 19 figures, 16 tables