该论文提出MRSeg框架,用于语言引导的医学图像分割。现有文本引导方法主要改进图像与语言特征的交互方式,但普遍对所有图像-文本对沿用单一的学习更新路径。MRSeg则利用每个图像-文本对来路由视觉与文本特征的自适应调整:冻结的ConvNeXt-Tiny和PubMedBERT编码器分别提取多尺度视觉特征与临床文本标记,联合路由器基于最深视觉特征和池化文本预测低秩适配器基的稀疏混合,该路由在两个视觉尺度与文本的独立适配器库间共享,实现协同适配并保持特征专属参数分离。区域桥模块以文本派生查询将稠密视觉标记聚合为潜在区域,经自注意力和文本交叉注意力精炼后回传至特征图,最终由多尺度解码器融合精炼语义特征与浅层图像证据。在QaTa-COV19和MosMedData+数据集上,MRSeg分别取得90.90/83.32和81.53/68.82的Dice/mIoU,可训练参数仅7.11M,计算量7.60 GFLOPs,兼顾精度与参数效率。
| MRSeg | 本文提出的参数高效框架,通过路由机制自适应调整视觉和文本特征,用于语言引导的医学图像分割。 |
| 低秩适配器 | 一种参数高效的微调方法,通过低秩分解引入少量可训练参数来适配预训练模型。 |
| 区域桥 | MRSeg中的模块,利用文本查询聚合视觉标记为潜在区域,并通过注意力机制细化后重新分配。 |
| Dice/mIoU | 医学图像分割中常用的两个评价指标,分别衡量预测区域与真实区域的重叠程度和平均交并比。 |
| QaTa-COV19 | 一个公开的医学图像分割数据集,包含COVID-19相关的胸部X光图像和文本描述。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅