本研究针对自动语音识别系统在儿童及非母语者语音上表现不佳、而将成人语音模型适配至儿童语音又会导致成人语音识别能力退化的问题,在阿拉伯语和英语两种语言上系统考察了儿童语音适配与成人语音保持之间的权衡。研究比较了全量微调、LoRA 以及事后权重空间合并三种策略,覆盖编码器—解码器、编码器—CTC 和基于 AudioLLM 的语音识别系统,并使用阿拉伯语母语及非母语儿童语音、英语 MyST 儿童语音,以及 MGB-2 和 LibriSpeech test-clean 成人基准进行评测,以词错误率和保持指数、儿童适配增益、适配恢复等指标量化适配与保持的权衡。结果显示,儿童语音适配确有必要,尤其对非母语阿拉伯语和英语儿童语音,但直接适配常损害成人语音识别性能;双语适配比单语适配更稳定;权重空间合并在多数情况下能改善这一权衡,其中 LERP 更利于成人保持,TIES 能恢复更强的儿童适配增益,而对编码器—解码器模型而言,直接双语微调在原始词错误率上仍表现最佳。
| ASR | 自动语音识别,将语音信号转换为文本的技术。 |
| LoRA | 低秩适应,一种参数高效微调方法,通过低秩矩阵更新模型权重。 |
| WER | 词错误率,衡量语音识别系统性能的常用指标,计算错误词数与总词数的比例。 |
| AudioLLM | 基于大型语言模型的音频处理系统,通常结合语音和语言模型进行识别。 |
| 权重空间合并 | 将不同模型或适配后的权重在参数空间进行合并的技术,以平衡不同任务性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅