7.5小时数据自适应,说话人日志性能提升却暗藏身份一致性崩塌!
When Forgetting Looks Like Improvement: Metric Masking in Streaming Diarizer Adaptation and the Price of Rehearsal
arXiv CL (cs.CL) 重要 论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文研究了流式说话人分离模型在小数据适配中的一种隐蔽失效模式:适配虽能提升语音检测性能,却可能同时损害说话人归属能力。作者在一个已发布的流式分离系统上,用7.5小时双人对话数据进行适配,并在六个语料库上评估。结果显示,适配显著提升了域内分离表现,并能迁移到独立语料库,但这种提升并不稳定,额外的混淆主要源于时间身份一致性受损,而非说话人数目估计错误。局部重映射诊断进一步揭示,不同语料库呈现不同的身份退化模式,说明适配可能改变了模型随时间维持说话人分配的方式。研究还发现,排练虽能减轻退化,却会牺牲跨域迁移性能。该工作提示,评估流式分离系统的适配效果时,需同时考察检测精度、身份一致性与知识保持行为。

🔑 关键词速览

流式说话人日志实时识别语音中“谁在什么时候说话”的任务,需在音频流中持续跟踪说话人身份。
小数据自适应使用少量目标领域数据对预训练模型进行微调,以提升特定场景下的性能。
排练在自适应过程中混合原始训练数据或旧任务数据,以缓解灾难性遗忘的技术。
时间身份一致性模型在时间轴上对同一说话人身份保持稳定分配的能力,避免身份跳变或混淆。
局部重映射诊断一种通过分析说话人标签在时间上的局部映射变化来诊断身份退化模式的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅