该研究针对多模态皮肤病变分类中临床元数据在部署阶段常不完整、且资源受限场景要求计算效率的问题,提出一种掩码特权信息蒸馏框架。方法上,以使用完整元数据训练的多模态教师模型,监督一个规模小9.2倍、且临床字段被随机整组掩码的学生模型,掩码率按样本从U(0,1)采样,使单次训练即可覆盖元数据从完整到缺失的全部可用性范围;融合采用残差方式,将元数据作为门控修正叠加到纯图像基线上。在PAD-UFES-20数据集上,掩码训练下的蒸馏在各可用性水平均优于交叉熵训练,平均提升4.7个百分点,而无掩码时仅提升1.8个百分点;当元数据从完整降至完全缺失时,掩码学生模型仅损失7.8个平衡准确率点,而用完整元数据训练的同一学生模型损失达36.6点,说明掩码训练本身对性能的平滑退化起关键作用。Grad-CAM可视化显示,随着元数据被撤除,掩码学生的注意力总体仍集中于病变区域。该紧凑模型面向临床元数据常不完整的即时检测场景,具有实际应用价值。
| 特权信息蒸馏 | 一种知识蒸馏方法,其中教师模型在训练时使用学生模型无法获得的额外信息(特权信息)来指导学生模型学习。 |
| 多模态皮肤病变分类 | 结合临床图像和患者元数据(如年龄、性别、病变位置)等多种模态信息对皮肤病变进行分类诊断的任务。 |
| 掩蔽训练 | 在训练过程中随机掩蔽部分输入特征(如临床字段),使模型学会在信息不完整时进行稳健预测。 |
| 平衡准确率 | 一种评估指标,计算每个类别召回率的平均值,适用于类别不平衡的数据集。 |
| Grad-CAM | 梯度加权类激活映射,一种可视化技术,通过梯度信息生成热力图以显示模型关注图像中的哪些区域。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅