本研究提出一种融合单模态与视觉-语言表征的框架,用于多标签胸部X光分类。方法上,将RAD-DINO提供的单模态视觉表征与BioViL-T提供的视觉-语言表征分别在潜在空间中精炼,再经归一化后跨三分支融合,在MIMIC-CXR-JPG数据集上完成14类标签的分类。实验发现,单独使用时RAD-DINO优于BioViL-T,而早期融合可进一步提升性能,说明两种嵌入来源具有互补信息。最佳模型取得0.840的平均AUROC和0.467的mAP。消融分析表明,当各分支表征在潜在空间中得到精炼时,混合融合相较早期融合带来一致且统计显著的提升,说明融合效果取决于各分支所提供表征的质量。研究同时指出,目前仅在MIMIC-CXR-JPG上完成内部评估,跨机构泛化能力尚待验证。
| RAD-DINO | 一种基于自监督学习的单模态视觉模型,专门用于放射学图像的特征提取。 |
| BioViL-T | 一种视觉-语言预训练模型,结合医学图像和文本报告来学习多模态表示。 |
| MIMIC-CXR-JPG | 一个大型公开的胸部X射线图像数据集,包含带标签的JPG格式图像和临床报告。 |
| AUROC | 接收者操作特征曲线下的面积,用于评估二分类模型的性能,值越高表示性能越好。 |
| mAP | 平均精度均值,是多标签分类中常用的评价指标,综合了不同标签的精度和召回率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅