胸部X光14标签分类新突破:双模型融合AUROC冲到0.840!
Integrating Unimodal and Vision-Language Representations in Latent Space for Multi-Label Chest X-Ray Classification
arXiv CV (cs.CV) 重要 #医学影像#多标签分类#视觉语言模型#胸片 🕐 09-10 12:00

📖 AI 总结

本研究提出一种融合单模态与视觉-语言表征的框架,用于多标签胸部X光分类。方法上,将RAD-DINO提供的单模态视觉表征与BioViL-T提供的视觉-语言表征分别在潜在空间中精炼,再经归一化后跨三分支融合,在MIMIC-CXR-JPG数据集上完成14类标签的分类。实验发现,单独使用时RAD-DINO优于BioViL-T,而早期融合可进一步提升性能,说明两种嵌入来源具有互补信息。最佳模型取得0.840的平均AUROC和0.467的mAP。消融分析表明,当各分支表征在潜在空间中得到精炼时,混合融合相较早期融合带来一致且统计显著的提升,说明融合效果取决于各分支所提供表征的质量。研究同时指出,目前仅在MIMIC-CXR-JPG上完成内部评估,跨机构泛化能力尚待验证。

🔑 关键词速览

RAD-DINO一种基于自监督学习的单模态视觉模型,专门用于放射学图像的特征提取。
BioViL-T一种视觉-语言预训练模型,结合医学图像和文本报告来学习多模态表示。
MIMIC-CXR-JPG一个大型公开的胸部X射线图像数据集,包含带标签的JPG格式图像和临床报告。
AUROC接收者操作特征曲线下的面积,用于评估二分类模型的性能,值越高表示性能越好。
mAP平均精度均值,是多标签分类中常用的评价指标,综合了不同标签的精度和召回率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅