NVIDIA 的研究团队针对沙特阿拉伯方言(Najdi 和 Hijazi)对 Nemotron 3.5 ASR 模型进行了微调。尽管该模型原生支持 40 种语言区域的流式转录,但在特定方言和本地录音条件下表现仍不理想。研究采用 NeMo 框架,结合最小化数据整理、加权回放混合、时长分桶和部分编码器解冻等策略,在 133.7 小时方言语音上微调后,将目标测试集的词错误率从 55.05% 降至 29.96%,同时英语性能略有提升,其他阿拉伯方言未受影响。此外,通过扩大注意力上下文并采用 beam-8 MALSD 解码,无需重新训练即可再降低 2.71 个百分点的错误率,代价是增加约 800 毫秒延迟。该工作还引入说话人分离功能,支持最多八人的说话人归属转录,为多语言方言适配提供了可复用的技术路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅