BuzzASR 是一套面向 102 种语言的语音识别模型集合,通过对 Whisper 进行语言特化微调构建而成。研究背景在于,Whisper 等主流端到端语音识别模型高度多语言化,导致其在训练数据覆盖不足的语言上表现欠佳。该工作将单语数据微调这一简单策略大规模扩展至 FLEURS 数据集覆盖的 102 种语言,并引入单语分词器替换与基于纯文本微调的数据增强等更复杂的语言适配方法。结果显示,BuzzASR 在 102 种语言中的 77 种上优于 Whisper-large-v3,平均字符错误率降低超过 2.8 倍;在 FLEURS 与 Common Voice 联合测试集上,有 27 种语言达到开源系统的最优字符错误率。分词器替换策略使压缩率平均提升 3.3 倍,最高达 21.7 倍。所有模型、代码与详细结果均已公开。
| BuzzASR | 本文提出的语言专用语音识别模型集合,包含 102 种语言的微调 Whisper 模型。 |
| Whisper | OpenAI 发布的大规模多语言端到端 Transformer 语音识别模型系列。 |
| FLEURS | 一个覆盖 102 种语言的多语言语音识别基准数据集,常用于评估跨语言 ASR 性能。 |
| 字符错误率(CER) | 衡量语音识别输出与参考文本在字符级别差异的指标,值越低表示识别越准确。 |
| 分词器替换 | 将多语言 BPE 分词器替换为单语言分词器,以提高目标语言的 token 压缩率和建模效率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅