护士每月5万条咨询,新分诊系统召回率从0.565飙到0.810!
Auditable Emergency Triage for Maternal and Newborn Care in India
arXiv CL (cs.CL) 重要 大模型医疗可解释性 🕐 09-10 12:00

📖 AI 总结

印度Noora Health的护士每月通过WhatsApp服务处理逾5万条医疗咨询,其中最具时效性的任务是急诊分诊,即判断哪些咨询需要立即线下就医。原有系统依赖大语言模型直接分类并生成推理链,但存在不透明、难以规模化审查错误、提示词改动需全量重评等问题。为此,研究团队将分诊拆解为两步:由大语言模型依据临床医生编写的词汇表提取规范症状与患者背景,再由确定性规则引擎判定是否属于急诊场景。新系统将召回率从0.565提升至0.810,F1从0.606提升至0.702,准确率提升主要来自结构化规则,而分步设计则带来可审计性,临床专家可逐环节排查翻译、症状提取、背景推断或规则缺失等问题,并能独立新增规则而不引发回归。部署以来系统已分诊152421条咨询,标记28535条(18.7%)为急诊,过度升级率为17.8%,未增加漏诊,临床医生已新增48条规则。

🔑 关键词速览

紧急分诊在医疗场景中,快速判断患者病情紧急程度并决定是否需要立即当面处理的过程。
大型语言模型(LLM)一种基于深度学习的自然语言处理模型,能够理解和生成人类语言,用于文本分类和推理等任务。
确定性规则引擎基于预定义规则进行逻辑判断的系统,其输出完全由输入和规则决定,具有可预测性和可审计性。
召回率分类任务中,正确识别出的正例占所有实际正例的比例,衡量模型发现紧急情况的能力。
F1分数精确率和召回率的调和平均数,综合衡量分类模型的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅