Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces
自监督语音模型通过位置依赖的正交子空间编码音素上下文
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; UC Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究自监督语音模型如何在单帧层面编码音素及其上下文,提出通过位置依赖的正交子空间实现音素信息的组合编码,揭示了上下文依赖表示的结构特性。
Comments Submitted to Interspeech 2026