临床笔记包含大量患者诊疗信息,但只有去除受保护健康信息后才能用于研究。现有方法多将去标识化视为单纯的检测问题,而仅靠检测并不充分:直接删改会连同临床内容一并丢失,日期置空会破坏纵向分析所需的时间间隔,每次出现都分配新的随机替代值则会切断同一患者笔记间的关联。为此,作者提出TIDE 2.0,一个MIT许可的开源引擎,将流程拆分为可互换的识别器与基于密钥的匿名化器两个独立阶段,均可在机构自有硬件上运行。其替代值以密码学方式生成,不保存链接表;日期按患者进行保持间隔的偏移;同一密钥下同一值在所有出现处获得相同替代;新密钥生成的发布版本无法与旧版本关联。作者同时发布从大语言模型蒸馏得到的识别器TIDE2-Sentry。在两个机构的金标注语料上,默认配置的跨度级召回率分别为域内0.88和跨机构0.77,精确率分别为0.88和0.87。该引擎开源,识别器以受限研究用途协议提供,便于机构在自有环境中运行、审查和扩展。
| 去标识化 (De-identification) | 从临床文本中移除或替换受保护健康信息(PHI),使数据可用于研究而不泄露患者身份。 |
| 受保护健康信息 (PHI) | 美国 HIPAA 法规定义的、可识别个人身份的健康相关信息,如姓名、日期、地址等。 |
| 带密钥的匿名化器 (Keyed Anonymizer) | 使用密钥生成密码学替代值的组件,确保同一患者数据在不同出现处获得一致替代,且不同密钥下发布的数据无法关联。 |
| TIDE2-Sentry | 从大语言模型蒸馏得到的识别器,用于检测临床笔记中的 PHI 实体。 |
| 跨度级召回率 (Span-level Recall) | 在实体识别中,正确识别出的实体跨度占所有真实实体跨度的比例,衡量检测的完整性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅