该研究探讨了自动语音识别(ASR)系统中幻觉现象的产生机制,将其视为转录文本与音频输入之间“接地失败”的结果。研究者对CTC和RNN-T两种独立训练的Conformer-Large模型进行了环境退化和说话者背景偏移测试,发现最终编码器阶段是关键的临界点:绕过该阶段会导致几乎所有话语的输出发散,而绕过中间阶段影响甚微。在此阶段,表征变得更紧凑,文本可被解码器读取,字素信息也趋于明确。值得注意的是,干预产生的是杂乱或重复的输出,而非流畅的虚构内容,说明该阶段失效是幻觉产生的机制性前提,而非自然幻觉的完整成因。研究揭示了两种解码器家族在多种分布偏移下对末端阶段的一致依赖,为理解ASR幻觉的根源提供了重要线索。
| ASR hallucination | 自动语音识别系统生成的与输入语音无关但流畅的文本,被视为接地失败的一种表现。 |
| grounding failure | 转录文本未能充分受音频引导,导致输出与语音内容脱节的现象。 |
| Conformer-Large | 一种基于卷积增强Transformer的大型语音识别模型架构,用于处理序列数据。 |
| CTC | 连接时序分类(Connectionist Temporal Classification),一种用于序列到序列对齐的损失函数,常用于语音识别。 |
| RNN-T | 循环神经网络转录器(Recurrent Neural Network Transducer),一种端到端语音识别模型,结合编码器和预测网络。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅