该研究针对生物医学文本分类中因自动PDF解析产生的噪声问题,提出了一种可审计的拼写校正可靠性层。该模块采用保守策略,在不确定时放弃编辑,遵循医学“不伤害”原则,通过有界编辑距离生成候选词、结合语料库n-gram评分及生物医学安全门控来保护专业术语。在2,104个词级案例的基准测试中,该层实现了94.61%的错误修复召回率且无有害编辑;在CORD-19三分类任务中,恢复了约80.45%的噪声导致的性能损失,将宏F1从0.7654提升至0.7717,接近干净文本的0.7721。案例研究还发现Transformer对轻度噪声相对鲁棒,为未来融合神经信号与UMLS词表的灰盒架构提供了方向。该系统完全确定性、可审计,适合实际部署。
| OCR-like artifacts | 类似OCR(光学字符识别)产生的伪影,指文本中因扫描或解析错误导致的字符错误、乱码等噪声。 |
| spell-correction reliability layer | 拼写纠正可靠性层,一种预处理模块,旨在安全地修复文本错误,同时避免引入新错误。 |
| do-no-harm philosophy | 不伤害原则,源自医学伦理,此处指在不确定时不进行编辑,以避免造成损害。 |
| bounded edit-distance | 受限编辑距离,一种字符串相似度度量,限制编辑操作次数,用于生成候选纠正词。 |
| CORD-19 | COVID-19开放研究数据集,一个包含大量COVID-19相关论文的语料库,常用于文本分类任务。 |
| BioBERT | 一种基于BERT的预训练语言模型,专门针对生物医学文本进行优化,用于生物医学NLP任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅