🔥 今日值得一读 临床笔记去标识化新引擎TIDE 2.0:召回率0.88,开源免费用!
TIDE 2.0: an open, model-agnostic engine for keyed de-identification of clinical notes
arXiv CL (cs.CL) 🔥 重点 #临床NLP#去标识化#隐私保护 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
处理临床文本研究时可用它做键控去标识,保留时间与患者关联而非简单删改。

📖 AI 总结

临床笔记包含大量患者诊疗信息,但只有去除受保护健康信息后才能用于研究。现有方法多将去标识化视为单纯的检测问题,而仅靠检测并不充分:直接删改会连同临床内容一并丢失,日期置空会破坏纵向分析所需的时间间隔,每次出现都分配新的随机替代值则会切断同一患者笔记间的关联。为此,作者提出TIDE 2.0,一个MIT许可的开源引擎,将流程拆分为可互换的识别器与基于密钥的匿名化器两个独立阶段,均可在机构自有硬件上运行。其替代值以密码学方式生成,不保存链接表;日期按患者进行保持间隔的偏移;同一密钥下同一值在所有出现处获得相同替代;新密钥生成的发布版本无法与旧版本关联。作者同时发布从大语言模型蒸馏得到的识别器TIDE2-Sentry。在两个机构的金标注语料上,默认配置的跨度级召回率分别为域内0.88和跨机构0.77,精确率分别为0.88和0.87。该引擎开源,识别器以受限研究用途协议提供,便于机构在自有环境中运行、审查和扩展。

🔑 关键词速览

去标识化 (De-identification)从临床文本中移除或替换受保护健康信息(PHI),使数据可用于研究而不泄露患者身份。
受保护健康信息 (PHI)美国 HIPAA 法规定义的、可识别个人身份的健康相关信息,如姓名、日期、地址等。
带密钥的匿名化器 (Keyed Anonymizer)使用密钥生成密码学替代值的组件,确保同一患者数据在不同出现处获得一致替代,且不同密钥下发布的数据无法关联。
TIDE2-Sentry从大语言模型蒸馏得到的识别器,用于检测临床笔记中的 PHI 实体。
跨度级召回率 (Span-level Recall)在实体识别中,正确识别出的实体跨度占所有真实实体跨度的比例,衡量检测的完整性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅