本研究提出一种可扩展的声学掩蔽方法,用于量化辅音对单词可懂度的贡献。具体做法是逐一静音单词中的某个辅音,再测试自动语音识别模型能否仍正确识别该词,并以掩蔽引发的误识率作为该辅音的贡献分数。研究用音素频率和功能负荷两个语言学指标验证该分数,并在英语、西班牙语、德语和捷克语四种语言及三种语音识别架构上进行实验。偏斯皮尔曼相关分析显示,音素频率与误识率呈负相关,功能负荷与误识率呈正相关,即高频辅音被掩蔽时干扰较小,而承载更多词汇对比功能的辅音被掩蔽时干扰更大。跨语言比较还发现,辅音贡献排序在不同语言间并不一致,说明其具有语言依赖性。该方法的潜在意义在于,可为运动性言语障碍的康复治疗提供可扩展的干预优先级排序依据。
| Acoustic Masking | 通过静音或噪声掩盖语音中的特定音段,以测试其对整体语音理解的影响。 |
| Mask-Induced Misrecognition Rate (MMR) | 掩蔽一个辅音后,自动语音识别模型将单词误识别的比例,用于量化该辅音的贡献。 |
| Functional Load | 语言学中衡量一个音素在区分词汇时承载多少对比功能的指标。 |
| Automatic Speech Recognition (ASR) | 自动将语音信号转换为文本的技术,本文使用多种ASR模型评估辅音贡献。 |
| Partial Spearman Correlation | 在控制其他变量后,计算两个变量之间秩相关性的统计方法,用于分析MMR与语言因素的关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅