20,523张切片8大任务实测!SlideMix让病理AI诊断准确率全面飙升,即插即用真香!
SlideMix: Enhancing Whole Slide Image Analysis via Multimodal Shuffling
arXiv CV (cs.CV) 重要 #医学影像#数据增强#多模态 🕐 09-02 12:00

📖 AI 总结

本文介绍了SlideMix,一种面向全切片图像(WSI)分析的模型无关多模态数据增强框架。WSI分析面临图像尺度巨大、组织异质性强、弱监督标签噪声和诊断区域稀疏等挑战,现有基于多实例学习(MIL)的增强方法常破坏组织结构和跨尺度信息。SlideMix通过三个核心模块解决这些问题:利用检索增强的视觉语言模型(VLM)选择诊断相关区域以降低标签噪声;在保留切片上下文的前提下对特征嵌入进行原地块洗牌;并通过VLM软标签和课程学习机制动态调节洗牌粒度与比例,促进跨尺度表征学习。在涵盖11个数据集、20523张切片、8项诊断任务和10种WSI骨干网络的实验中,SlideMix在多数场景下显著提升了准确率和泛化能力,优于现有增强基线,为数字病理分析提供了即插即用的稳健方案。

🔑 关键词速览

SlideMix一种用于全切片图像分析的多模态增强框架,通过洗牌和混合特征提升模型性能。
Multiple Instance Learning (MIL)多实例学习,一种处理弱监督学习的方法,将包中的实例聚合为预测。
Vision-Language Model (VLM)视觉-语言模型,结合图像和文本信息进行推理的模型,用于区域选择和软标签生成。
Curriculum Learning课程学习,一种训练策略,从简单样本开始逐步增加难度,以提升模型泛化能力。
Whole Slide Image (WSI)全切片图像,高分辨率的病理组织扫描图像,用于数字病理分析。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅