该研究针对乳腺X线摄影中CLIP式视觉语言模型(VLM)零样本表现不佳的问题,提出了一种名为TopKSigLIP的新模型。作者认为性能瓶颈源于两个数据特性:图像高分辨率与放射报告的高度同质性(以阴性/良性发现为主)。为此,模型引入TopK-Patch模块,通过学习采样包含病灶的高分辨率稀疏补丁,避免了分辨率与批处理大小的权衡,同时提供内置定位功能;并采用Sup-sigmoid损失替代传统对比损失,利用结构化数据生成的软标签减少语义相似对的错误排斥。实验表明,TopKSigLIP在密度评估、BI-RADS分类、发现亚型及癌症预测等零样本任务上优于现有开源乳腺及通用医学VLM,线性探测下仍具竞争力,且病灶定位优于Grad-CAM。该工作为高分辨率医学图像VLM训练提供了新思路。
| CLIP-style vision-language model (VLM) | 一种结合视觉和语言信息的预训练模型,通过对比学习对齐图像和文本表示。 |
| TopKSigLIP | 本文提出的新型VLM,通过TopK-Patch模块和Sup-sigmoid损失解决乳腺X线摄影中的高分辨率和报告同质性问题。 |
| TopK-Patch module | 一种学习采样高分辨率图像中稀疏且可能包含病灶的补丁的模块,用于降低计算负担并提供定位功能。 |
| Sup-sigmoid loss | 一种基于软标签的sigmoid损失扩展,用于处理报告同质性,避免错误排斥语义相似的样本对。 |
| BI-RADS | 乳腺影像报告和数据系统,用于标准化乳腺X线摄影发现和风险评估的分类标准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅