29万份肿瘤笔记训练新模型,困惑度从2035降到2.83!
OncoNoteBERT: A Foundation Representation Model for Natural Language Processing of Real-World Outpatient Oncology Notes
arXiv CL (cs.CL) 重要 #医学NLP#预训练模型#临床文本 🕐 今天 12:00

📖 AI 总结

本研究针对真实世界门诊肿瘤病历的自然语言处理需求,开发并评估了肿瘤学专用的BERT类编码器。研究基于英国受治理的门诊肿瘤语料库,涵盖21564名肺癌和头颈癌患者的290026份病历,对比了RadBERT、PathologyBERT两种外部模型与两种本地策略:继续掩码语言模型预训练得到的OncoNote-RadBERT,以及使用肿瘤学WordPiece分词器从零训练的OncoNoteBERT。结果显示,外部编码器在零样本评估中对肿瘤语料拟合较差,困惑度分别高达113.04和2035.03;继续预训练模型拟合最佳,困惑度为2.10,OncoNoteBERT为2.83,但其分词效率最高,子词碎片化更低、归一化序列更短,且在13项掩码词探测中12项给出临床可接受的预测,优于OncoNote-RadBERT的7项。研究表明,继续适配与定制分词具有互补优势,在将邻近领域编码器应用于肿瘤学NLP之前,表示层设计至关重要。

🔑 关键词速览

OncoNoteBERT一种专为肿瘤学门诊笔记设计的BERT风格编码器,使用肿瘤学专用WordPiece分词器从头训练。
RadBERT一种针对放射学文本预训练的BERT模型,作为外部基线在肿瘤学语料库上进行评估。
PathologyBERT一种针对病理学文本预训练的BERT模型,作为外部基线在肿瘤学语料库上进行评估。
掩码语言建模(MLM)一种预训练任务,模型预测输入文本中被随机掩码的标记,用于学习语言表示。
困惑度(Perplexity)衡量语言模型预测样本概率的指标,值越低表示模型对语料的拟合越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅