该论文提出了一种名为Dual-Form ASR(DF-ASR)的框架,用于中文语音识别中的语义感知逆文本规范化(ITN)。传统方法通常将语音识别与ITN作为级联模块处理,导致书面形式输出易受识别错误影响,且数值表达等语义依赖内容的规范化效果不佳。DF-ASR通过配对的口语与书面形式监督,将口语ASR能力扩展至语义感知的书面形式ITN,并支持提示级别选择输出形式。其监督数据由大语言模型驱动的生成-评判流程构建,训练中引入ITN-MWER序列级目标以强化对规范化敏感片段的错误惩罚。在SpeechIO人工标注中文子集上,DF-ASR持续优于开源ASR-ITN系统,与强闭源系统表现相当,并保持了可靠的提示级控制能力。
| Dual-Form ASR (DF-ASR) | 一种同时支持口语形式和书面形式输出的语音识别框架,通过联合监督实现语义感知的逆文本正则化。 |
| Inverse Text Normalization (ITN) | 将口语形式的文本(如数字、日期)转换为可读书面形式的过程。 |
| ITN-MWER | 一种序列级训练目标,对规范化敏感跨度上的错误赋予更高权重,以提升ITN性能。 |
| REQUIRE-ITN/FORBID-ITN protocol | 一种评估协议,分别衡量需要规范化的内容是否被正确转换,以及禁止规范化的跨度是否被保留。 |
| generate-and-judge workflow | 一种利用大型语言模型生成候选数据并评判其质量的工作流,用于构建训练监督信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅