MedWER提出了一种面向医疗语音识别(ASR)的可复现、无模型评估协议。传统词错误率(WER)会掩盖临床关键错误,例如转录文本虽达95%正确率,仍可能混淆药物名称。现有方案依赖评估时的命名实体识别(NER)模型或云API,导致指标分母成为版本化的黑箱。MedWER的解决方案是采用固定且许可清晰的术语列表(涵盖19,373个药物、诊断、症状及损伤机制条目)作为分母,并配合固定版本的文本归一化器与短语感知的术语受限WER计算。其覆盖范围通过独立省级药品福利文件验证,匹配启发式则基于真实实体跨度校准。研究团队发布了开源工具,并对Moonshine base、Whisper及MedASR在两项公开基准上进行了评分,报告了基于重采样每话语分数的95%置信区间。该协议旨在提升医疗ASR评估的透明度与临床相关性。
| MedWER | 一种用于医学语音识别的评估协议,通过固定术语列表计算词错误率,避免依赖NER模型。 |
| Word Error Rate (WER) | 词错误率,衡量语音识别转录文本与参考文本之间差异的指标。 |
| Named-Entity Recognition (NER) | 命名实体识别,用于从文本中识别特定实体(如药物、疾病)的技术。 |
| ASR | 自动语音识别,将语音转换为文本的技术。 |
| Term-Restricted WER | 术语受限的词错误率,仅针对特定术语列表计算错误,以聚焦临床关键实体。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅