DF-ASR让语音识别同时输出口语和书面语,提示级控制+语义感知ITN,中文数字表达准确率飙升!
Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition
arXiv CL (cs.CL) 重要 #语音识别#ASR#训练方法 🕐 09-04 12:00

📖 AI 总结

该论文提出了一种名为Dual-Form ASR(DF-ASR)的框架,用于中文语音识别中的语义感知逆文本规范化(ITN)。传统方法通常将语音识别与ITN作为级联模块处理,导致书面形式输出易受识别错误影响,且数值表达等语义依赖内容的规范化效果不佳。DF-ASR通过配对的口语与书面形式监督,将口语ASR能力扩展至语义感知的书面形式ITN,并支持提示级别选择输出形式。其监督数据由大语言模型驱动的生成-评判流程构建,训练中引入ITN-MWER序列级目标以强化对规范化敏感片段的错误惩罚。在SpeechIO人工标注中文子集上,DF-ASR持续优于开源ASR-ITN系统,与强闭源系统表现相当,并保持了可靠的提示级控制能力。

🔑 关键词速览

Dual-Form ASR (DF-ASR)一种同时支持口语形式和书面形式输出的语音识别框架,通过联合监督实现语义感知的逆文本正则化。
Inverse Text Normalization (ITN)将口语形式的文本(如数字、日期)转换为可读书面形式的过程。
ITN-MWER一种序列级训练目标,对规范化敏感跨度上的错误赋予更高权重,以提升ITN性能。
REQUIRE-ITN/FORBID-ITN protocol一种评估协议,分别衡量需要规范化的内容是否被正确转换,以及禁止规范化的跨度是否被保留。
generate-and-judge workflow一种利用大型语言模型生成候选数据并评判其质量的工作流,用于构建训练监督信号。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅