新课程训练让视觉语音识别词错误率直降,LRS2和LRS3双基准全面提效!
Curriculum-Based Noise Adaptation for Phoneme-to-Text Reconstruction in Visual Speech Recognition
arXiv CL (cs.CL) 重要 #视觉语音识别#课程学习#音素重建 🕐 今天 12:00

📖 AI 总结

本文针对音素中心型视觉语音识别中音素到文本重建模型的鲁棒性问题提出改进方案。现有重建方法通常在干净音素序列或人工合成噪声上训练,导致训练条件与推理时真实出现的音素预测误差之间存在不匹配。为此,作者提出渐进式错误课程训练框架(PECT),通过合成音素扰动、多域伪标签以及由视觉语音识别器生成的目标域伪标签,逐步让基于NLLB的重建模型适应越来越接近真实的音素预测错误,在提升鲁棒性的同时保持句子重建准确率。在LRS2和LRS3基准上的实验表明,PECT可稳定提升多种音素前端(V-ASR、PV-ASR、HP-VSR)的重建性能,其中HP-VSR-FiLMFuse(L4)在LRS2上的词错误率由23.3%降至22.2%,HP-VSR-ResFiLM在LRS3上由30.3%降至29.7%。消融与定性分析进一步验证了渐进适应的有效性,表明该课程学习策略具有通用性和推广价值。

🔑 关键词速览

PECT (Progressive Error Curriculum Training)本文提出的渐进式错误课程训练框架,通过逐步引入越来越真实的音素预测错误来提升音素到文本重建模型的鲁棒性。
NLLB (No Language Left Behind)Meta 提出的多语言神经机器翻译模型,本文将其作为音素到文本重建模型的骨干架构。
VSR (Visual Speech Recognition)视觉语音识别,通过分析说话人唇部等视觉信息来识别语音内容的技术。
WER (Word Error Rate)词错误率,语音识别中衡量识别结果与参考文本差异的常用评价指标,值越低表示性能越好。
Curriculum Learning课程学习,一种模仿人类学习过程的训练策略,按照从易到难的顺序组织训练样本以提升模型学习效果。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅