本研究针对真实世界门诊肿瘤病历的自然语言处理需求,开发并评估了肿瘤学专用的BERT类编码器。研究基于英国受治理的门诊肿瘤语料库,涵盖21564名肺癌和头颈癌患者的290026份病历,对比了RadBERT、PathologyBERT两种外部模型与两种本地策略:继续掩码语言模型预训练得到的OncoNote-RadBERT,以及使用肿瘤学WordPiece分词器从零训练的OncoNoteBERT。结果显示,外部编码器在零样本评估中对肿瘤语料拟合较差,困惑度分别高达113.04和2035.03;继续预训练模型拟合最佳,困惑度为2.10,OncoNoteBERT为2.83,但其分词效率最高,子词碎片化更低、归一化序列更短,且在13项掩码词探测中12项给出临床可接受的预测,优于OncoNote-RadBERT的7项。研究表明,继续适配与定制分词具有互补优势,在将邻近领域编码器应用于肿瘤学NLP之前,表示层设计至关重要。
| OncoNoteBERT | 一种专为肿瘤学门诊笔记设计的BERT风格编码器,使用肿瘤学专用WordPiece分词器从头训练。 |
| RadBERT | 一种针对放射学文本预训练的BERT模型,作为外部基线在肿瘤学语料库上进行评估。 |
| PathologyBERT | 一种针对病理学文本预训练的BERT模型,作为外部基线在肿瘤学语料库上进行评估。 |
| 掩码语言建模(MLM) | 一种预训练任务,模型预测输入文本中被随机掩码的标记,用于学习语言表示。 |
| 困惑度(Perplexity) | 衡量语言模型预测样本概率的指标,值越低表示模型对语料的拟合越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅