本文介绍了SlideMix,一种面向全切片图像(WSI)分析的模型无关多模态数据增强框架。WSI分析面临图像尺度巨大、组织异质性强、弱监督标签噪声和诊断区域稀疏等挑战,现有基于多实例学习(MIL)的增强方法常破坏组织结构和跨尺度信息。SlideMix通过三个核心模块解决这些问题:利用检索增强的视觉语言模型(VLM)选择诊断相关区域以降低标签噪声;在保留切片上下文的前提下对特征嵌入进行原地块洗牌;并通过VLM软标签和课程学习机制动态调节洗牌粒度与比例,促进跨尺度表征学习。在涵盖11个数据集、20523张切片、8项诊断任务和10种WSI骨干网络的实验中,SlideMix在多数场景下显著提升了准确率和泛化能力,优于现有增强基线,为数字病理分析提供了即插即用的稳健方案。
| SlideMix | 一种用于全切片图像分析的多模态增强框架,通过洗牌和混合特征提升模型性能。 |
| Multiple Instance Learning (MIL) | 多实例学习,一种处理弱监督学习的方法,将包中的实例聚合为预测。 |
| Vision-Language Model (VLM) | 视觉-语言模型,结合图像和文本信息进行推理的模型,用于区域选择和软标签生成。 |
| Curriculum Learning | 课程学习,一种训练策略,从简单样本开始逐步增加难度,以提升模型泛化能力。 |
| Whole Slide Image (WSI) | 全切片图像,高分辨率的病理组织扫描图像,用于数字病理分析。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅