该论文提出了一种名为蒸馏快速嵌入迁移(DRET)的参数高效领域自适应方法,旨在解决生物医学NLP任务中大型专用模型计算成本过高、而小型通用模型缺乏领域知识的问题。DRET通过从BioBERT等大型专用模型向DistilBERT等轻量级模型注入生物医学知识,无需在原始语料上重新训练。该方法发展出一系列迭代策略,包括统一分词器合并、混合嵌入平均、基于优先级的嵌入迁移机制,并结合嵌入层冻结、差分学习率、标签传播和不平衡感知损失函数。在EBM-NLP语料库的PICO分类任务中,DRET增强的DistilBERT(6600万参数)在平衡准确率、召回率和ROC-AUC等指标上达到甚至超过大一个数量级模型的表现,同时保持推理效率。该研究为资源受限环境下的生物医学文本挖掘提供了可扩展的解决方案,对自动化系统综述和临床决策支持具有直接应用价值。
| DRET | 蒸馏快速嵌入迁移,一种将大型专业模型知识注入小型通用模型的方法。 |
| PICO分类 | 将文本按人群、干预、比较和结局四个维度进行分类的任务。 |
| 嵌入迁移 | 将源模型的嵌入表示转移到目标模型的过程。 |
| DistilBERT | 一种轻量级通用语言模型,通过蒸馏技术压缩BERT。 |
| EBM-NLP语料库 | 用于证据医学NLP任务的标注数据集,常用于PICO分类。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅