该研究针对自监督语音编码器将语言信息与副语言信息纠缠于同一表征空间的问题,提出一种结合TopK稀疏自编码器、路由专属监督与跨因子对抗的训练方法。在冻结的SPEAR和WavLM编码器上,独立探针显示语言信息在语言路由中保留更强,而说话人身份、情感、韵律等副语言因素在副语言路由中得以保留,并在语言路由中被显著削弱。在LibriSpeech上学习到的路由组织无需在表征端重新训练即可迁移至MSP-Podcast。特征空间的路由干预还能实现因子交换的迁移,同时基本保持未改动路由所承载的信息。结果表明,这种路由选择性分离在不同编码器、语料库、独立探针及表征级干预下均保持一致,为语音表征的解耦提供了可行路径。
| TopK稀疏自编码器 | 一种仅保留前K个最大激活值的稀疏自编码器,用于学习可解释的稀疏表示。 |
| 路由特定监督 | 针对不同信息路径(如语言和副语言)分别施加的监督信号,以引导表示分离。 |
| 跨因子对抗 | 通过对抗训练消除不同因子(如语言与副语言)之间信息纠缠的方法。 |
| SPEAR | 一种自监督语音编码器模型,用于提取语音的通用表示。 |
| WavLM | 微软提出的自监督语音预训练模型,擅长学习语音的通用表示。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅