医学语音识别95%正确仍会开错药?MedWER用1.9万术语库揪出致命错误!
MedWER: A Reproducible, Model-Free Evaluation Protocol for Medical Speech Recognition
arXiv CL (cs.CL) 重要 #评测基准#语音识别#医疗AI 🕐 09-09 12:00

📖 AI 总结

MedWER提出了一种面向医疗语音识别(ASR)的可复现、无模型评估协议。传统词错误率(WER)会掩盖临床关键错误,例如转录文本虽达95%正确率,仍可能混淆药物名称。现有方案依赖评估时的命名实体识别(NER)模型或云API,导致指标分母成为版本化的黑箱。MedWER的解决方案是采用固定且许可清晰的术语列表(涵盖19,373个药物、诊断、症状及损伤机制条目)作为分母,并配合固定版本的文本归一化器与短语感知的术语受限WER计算。其覆盖范围通过独立省级药品福利文件验证,匹配启发式则基于真实实体跨度校准。研究团队发布了开源工具,并对Moonshine base、Whisper及MedASR在两项公开基准上进行了评分,报告了基于重采样每话语分数的95%置信区间。该协议旨在提升医疗ASR评估的透明度与临床相关性。

🔑 关键词速览

MedWER一种用于医学语音识别的评估协议,通过固定术语列表计算词错误率,避免依赖NER模型。
Word Error Rate (WER)词错误率,衡量语音识别转录文本与参考文本之间差异的指标。
Named-Entity Recognition (NER)命名实体识别,用于从文本中识别特定实体(如药物、疾病)的技术。
ASR自动语音识别,将语音转换为文本的技术。
Term-Restricted WER术语受限的词错误率,仅针对特定术语列表计算错误,以聚焦临床关键实体。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅