LLM当裁判过滤伪标签,嘈杂警用录音识别错误率大降!
Pretrained ASR Pseudo-labeling for Noisy Police Audio
arXiv AI (cs.AI) 语音论文方法 🕐 今天 12:00

📖 AI 总结

本文研究预训练语音识别系统在嘈杂警务广播通信音频上的适配问题。由于该类音频噪声大、领域特殊,现有基础模型(Whisper和Qwen3-ASR)表现不佳,而伪标签提供了一条无需昂贵人工标注的无监督改进路径。作者系统评估了伪标签在巴尔的摩和芝加哥两个警务通信语料上的效果与局限,发现模型内部的置信度指标(对数概率和STAR分数)无法有效区分高质量与低质量伪标签。为此,研究提出一种外部"LLM作为评判者"的过滤范式,利用参数化知识剔除上下文不合理的转写文本,该方法比内部指标过滤更激进,显著降低了伪标签训练集的词错误率,但与理想过滤仍存在明显差距。研究还提出跨模型伪标签范式,即用一个模型的伪标签微调另一个模型,并将其识别为未来值得探索的方向。

🔑 关键词速览

Pseudo-labeling一种半监督学习技术,使用模型生成的预测标签作为训练数据,以减少对人工标注的依赖。
Broadcast Police Communication (BPC)指警方通过广播进行的通信,通常包含大量背景噪声和特定术语,是语音识别的一个挑战性领域。
ASR自动语音识别,将语音信号转换为文本的技术。
LLM-as-a-judge使用大型语言模型作为评判者,评估或过滤文本质量的方法。
WER词错误率,衡量语音识别系统性能的常用指标,计算识别结果与参考转录之间的词级错误比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅