本文研究半监督联邦自动语音识别(ASR)训练,旨在缩小其与全监督联邦学习之间的差距。作者指出,伪标签误差会在输出序列和训练轮次间累积,导致模型发散,因此提出从“教师”和“锚点”两个相互关联的设计维度入手。教师方面,每客户端在线教师虽会单独发散,但经稳定后可媲美甚至超越广播式全局教师,且随种子数据增强,过渡式教师表现更优;锚点方面,服务器须在轮次间持续用标注数据训练,否则在线教师会漂移,这种交替训练比种子模型更决定收敛。研究还发现,稳定化需求取决于领域,受种子数据离散度及其与客户端数据重叠程度影响。该方法在11组对比中9组优于此前最强方法,域内平均提升20.8%,跨域提升10.0%。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅