泰米尔语语音检测准确率飙升16%!8.7MB小模型CPU跑通,成本仅5.69美元
TamilEOT: A Dataset and Model for Semantic End-of-Turn Detection in Tamil Telephone Speech
arXiv CL (cs.CL) #语音识别#数据集#多语言 🕐 09-09 12:00

📖 AI 总结

该研究发布了TamilEOT,一个面向泰米尔语电话语音的语义性话轮结束检测数据集与模型。数据集包含从116段真实电话录音中切分的18,485个标注话轮边界,并基于Smart Turn v3微调出两个仅依赖音频的检测器。在包含30通未见通话、4,168个片段的测试集上,模型准确率从零样本的70.30%提升至83.71%(8.7 MB模型)和86.13%(21 MB模型),ROC-AUC从0.751升至0.921,且单线程CPU推理时间低于150毫秒。研究还揭示了关键工程发现:规则派生标签在负类上准确率仅44.4%,低于随机水平,因其回答的问题与模型任务不一致;改用音频大模型标注器后,人工一致性达97.5%,成本仅5.69美元。实验表明,仅编码器容量显著影响性能,相同配置下三次运行的准确率波动达0.87个百分点,构成效应量下限;生产级VAD与流式适配器会额外损失2.60个百分点,且7.8%的边界无法送达模型。该工作填补了南印度语言在语义话轮结束检测领域的空白,并公开了全部数据、权重、代码及阴性结果。

🔑 关键词速览

TamilEOT一个用于泰米尔语电话语音语义性结束检测的数据集和模型名称。
End-of-Turn Detection检测对话中说话人是否已结束当前轮次的技术。
Smart Turn v3一个预训练的语音结束检测模型,作为微调的基础。
ROC-AUC受试者工作特征曲线下面积,衡量分类模型区分正负类的能力。
Audio-LLM Labeller使用音频大语言模型自动生成标注的工具,用于替代规则标签。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅