该研究开发了针对米佐语(一种低资源语言)的自动语音识别系统,通过收集并整理17.62小时的语音数据,对三种Whisper多语言模型及SraVaani 1.0印度多语言模型进行了微调。结果显示,Whisper-large-v3在传统词错误率上表现最佳,达到18.08%,而采用形态学感知评估后词错误率降至7.22%。SraVaani 1.0在零样本评估中词错误率为58.27%,但经米佐语特定微调后,传统词错误率降至29.45%,形态学感知词错误率降至17.93%。研究表明,Whisper模型即使面对未见语言也能实现较低词错误率,而SraVaani 1.0虽原生支持米佐语,但通过精心策划的语音数据微调可显著提升其性能。该研究为低资源语言的语音识别提供了有效方法,并展示了形态学感知评估在衡量模型真实表现中的价值。
| Automatic Speech Recognition (ASR) | 自动语音识别,将语音信号转换为文本的技术。 |
| Whisper | OpenAI开发的多语言语音识别模型系列,支持多种语言和微调。 |
| SraVaani 1.0 | 一个面向印度语言的预训练多语言语音识别模型。 |
| Word Error Rate (WER) | 词错误率,衡量语音识别系统性能的指标,越低越好。 |
| Morphology-aware evaluation | 基于形态学感知的评估方法,考虑词形变化对识别结果的影响。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅