这篇论文针对带口音的会话英语语音识别提出,仅以词错误率(WER)为优化目标的ASR系统往往会漏掉命名实体和填充停顿,而这两者对语言学习反馈至关重要。作者面向印度、印尼和拉美地区说话者构建了一个三阶段流水线:用启发式SQL过滤筛选实体密度达随机采样2.8倍的训练数据;基于Qwen2.5-Omni-3B微调区域LoRA适配器,单次前向即可同时输出逐字与修正转写;并建立六类错误分类体系,由大模型评判器验证(与人工标注一致率83.8%)。在6000条测试语音上,实体召回率从53-55%提升至80-85%,填充词召回率从不足5%提升至76-86%,WER控制在6-10%,实体召回优于Whisper和某商用系统,并以十分之一的参数量追平零样本30B模型。配对自助检验表明,仅数据筛选一项就贡献了2.8至4.2个百分点的实体召回增益。
| WER (Word Error Rate) | 词错误率,衡量ASR转录与参考文本之间词级差异的常用指标。 |
| LoRA (Low-Rank Adaptation) | 低秩适配,一种参数高效微调方法,通过注入低秩矩阵来适配大模型。 |
| Qwen2.5-Omni-3B | 通义千问2.5多模态大模型,参数量为30亿,支持文本、音频等多种模态。 |
| Entity Recall | 实体召回率,衡量ASR系统正确识别出命名实体(如人名、地名)的比例。 |
| Filler Recall | 填充词召回率,衡量ASR系统正确识别出填充停顿(如um、uh)的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅