该研究发布了TamilEOT,一个面向泰米尔语电话语音的语义性话轮结束检测数据集与模型。数据集包含从116段真实电话录音中切分的18,485个标注话轮边界,并基于Smart Turn v3微调出两个仅依赖音频的检测器。在包含30通未见通话、4,168个片段的测试集上,模型准确率从零样本的70.30%提升至83.71%(8.7 MB模型)和86.13%(21 MB模型),ROC-AUC从0.751升至0.921,且单线程CPU推理时间低于150毫秒。研究还揭示了关键工程发现:规则派生标签在负类上准确率仅44.4%,低于随机水平,因其回答的问题与模型任务不一致;改用音频大模型标注器后,人工一致性达97.5%,成本仅5.69美元。实验表明,仅编码器容量显著影响性能,相同配置下三次运行的准确率波动达0.87个百分点,构成效应量下限;生产级VAD与流式适配器会额外损失2.60个百分点,且7.8%的边界无法送达模型。该工作填补了南印度语言在语义话轮结束检测领域的空白,并公开了全部数据、权重、代码及阴性结果。
| TamilEOT | 一个用于泰米尔语电话语音语义性结束检测的数据集和模型名称。 |
| End-of-Turn Detection | 检测对话中说话人是否已结束当前轮次的技术。 |
| Smart Turn v3 | 一个预训练的语音结束检测模型,作为微调的基础。 |
| ROC-AUC | 受试者工作特征曲线下面积,衡量分类模型区分正负类的能力。 |
| Audio-LLM Labeller | 使用音频大语言模型自动生成标注的工具,用于替代规则标签。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅