本文介绍了一种名为AVERT的语音对话状态追踪方法,旨在解决语音识别错误在对话中持续累积的问题。研究指出,仅依赖文本转录的编辑方法虽能修正部分错误,但仍存在三类可恢复问题:跨轮次预测不一致、槽位遗漏以及音频不支持的值。AVERT通过结合跨轮次一致性与音频条件验证器,对候选值进行评分,并采用投票、添加和替换三种操作分别处理上述错误类型,且每种操作仅应用于错误高发的特定槽位。在SpokenWOZ数据集上的实验表明,基础语音大模型联合准确率为33.04,文本编辑器提升至38.34,而AVERT达到40.13,且无需重新训练任一组件。该性能与消耗完整语音历史的1B端到端系统相当(39.32),但AVERT仅使用两个1B解码器。研究还验证了音频验证器的显著增益,并强调限制操作范围的重要性,否则无约束投票会覆盖正确类别值,导致性能下降。
| Spoken Dialogue State Tracking (SDST) | 口语对话状态跟踪,从语音对话中提取槽值对以跟踪用户意图和对话状态。 |
| ASR errors | 自动语音识别错误,指语音转写过程中产生的错误,尤其在实体值上集中出现。 |
| JGA (Joint Goal Accuracy) | 联合目标准确率,衡量对话状态跟踪中所有槽值对预测完全正确的比例。 |
| AVERT | 本文提出的方法,结合跨轮次一致性和音频验证器,通过投票、添加、交换操作符修正对话状态跟踪错误。 |
| audio-conditioned verifier | 音频条件验证器,一种利用音频信息验证候选值是否被语音支持的模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅