人工标注100个《古兰经》录音案例,162个事件中AI最强一次仍漏掉7个!
What Counts as a Mistake? Annotating Recitation Events in Quran Memorization Transcripts
arXiv CL (cs.CL) #语音识别#标注#评测基准 🕐 09-14 12:00

📖 AI 总结

该研究针对古兰经背诵自动评测中的核心难题——如何从语音识别转写文本中区分真正的错误与重复、自我纠正、开场套语及可接受的拼写差异,完成了一项包含100个录音案例的人工标注工作,共标注348个评分单元和162个定位事件,涵盖十类组合标签,并配套开发了可同时评估标签与词位置的可执行评测器。基线方法中,简单差异比对在标签感知F1上仅达0.525,定位F1为0.826;经适配的清洗与对齐组件表现相近。初步试验显示,八次二十分钟的单次运行在标签感知F1上跨度从0.143到0.892,多数远超基线,但有一次因缺少归一化步骤而崩溃。研究进一步发现,972个金标事件中有970个能被预测覆盖,剩余难点并非检测本身,而是标注惯例的界定,如跨度范围及依赖裁决而非文本可见的标签边界;162个事件中有7个难倒所有同日运行,其中5个仅涉及一条正字法规则。该工作揭示了标注接口校验的必要性,并指出当前评测仅衡量了任务中算法的一半。

🔑 关键词速览

ASR自动语音识别,将语音转换为文本的技术。
F1F1分数,衡量分类模型精确率和召回率的调和平均指标。
标注人工为数据添加标签或注释的过程。
定位在文本中确定特定事件或错误位置的任务。
正字法语言中拼写和书写的规则系统。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅