一个辅音被静音,单词就听不懂?新方法用AI量化辅音贡献,跨4种语言验证!
Quantifying Consonant Contributions to Word Intelligibility via Acoustic Masking
arXiv CL (cs.CL) #语音识别#可懂度#医疗AI 🕐 09-14 12:00

📖 AI 总结

本研究提出一种可扩展的声学掩蔽方法,用于量化辅音对单词可懂度的贡献。具体做法是逐一静音单词中的某个辅音,再测试自动语音识别模型能否仍正确识别该词,并以掩蔽引发的误识率作为该辅音的贡献分数。研究用音素频率和功能负荷两个语言学指标验证该分数,并在英语、西班牙语、德语和捷克语四种语言及三种语音识别架构上进行实验。偏斯皮尔曼相关分析显示,音素频率与误识率呈负相关,功能负荷与误识率呈正相关,即高频辅音被掩蔽时干扰较小,而承载更多词汇对比功能的辅音被掩蔽时干扰更大。跨语言比较还发现,辅音贡献排序在不同语言间并不一致,说明其具有语言依赖性。该方法的潜在意义在于,可为运动性言语障碍的康复治疗提供可扩展的干预优先级排序依据。

🔑 关键词速览

Acoustic Masking通过静音或噪声掩盖语音中的特定音段,以测试其对整体语音理解的影响。
Mask-Induced Misrecognition Rate (MMR)掩蔽一个辅音后,自动语音识别模型将单词误识别的比例,用于量化该辅音的贡献。
Functional Load语言学中衡量一个音素在区分词汇时承载多少对比功能的指标。
Automatic Speech Recognition (ASR)自动将语音信号转换为文本的技术,本文使用多种ASR模型评估辅音贡献。
Partial Spearman Correlation在控制其他变量后,计算两个变量之间秩相关性的统计方法,用于分析MMR与语言因素的关系。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅