ASR漏掉的实体和停顿,被这套三阶段流水线找回来了:实体召回率从53%飙到85%,填充词从不足5%提到86%!
Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR
arXiv CL (cs.CL) 语音LoRA评估 🕐 今天 12:00

📖 AI 总结

这篇论文针对带口音的会话英语语音识别提出,仅以词错误率(WER)为优化目标的ASR系统往往会漏掉命名实体和填充停顿,而这两者对语言学习反馈至关重要。作者面向印度、印尼和拉美地区说话者构建了一个三阶段流水线:用启发式SQL过滤筛选实体密度达随机采样2.8倍的训练数据;基于Qwen2.5-Omni-3B微调区域LoRA适配器,单次前向即可同时输出逐字与修正转写;并建立六类错误分类体系,由大模型评判器验证(与人工标注一致率83.8%)。在6000条测试语音上,实体召回率从53-55%提升至80-85%,填充词召回率从不足5%提升至76-86%,WER控制在6-10%,实体召回优于Whisper和某商用系统,并以十分之一的参数量追平零样本30B模型。配对自助检验表明,仅数据筛选一项就贡献了2.8至4.2个百分点的实体召回增益。

🔑 关键词速览

WER (Word Error Rate)词错误率,衡量ASR转录与参考文本之间词级差异的常用指标。
LoRA (Low-Rank Adaptation)低秩适配,一种参数高效微调方法,通过注入低秩矩阵来适配大模型。
Qwen2.5-Omni-3B通义千问2.5多模态大模型,参数量为30亿,支持文本、音频等多种模态。
Entity Recall实体召回率,衡量ASR系统正确识别出命名实体(如人名、地名)的比例。
Filler Recall填充词召回率,衡量ASR系统正确识别出填充停顿(如um、uh)的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅