本文提出一个可解释的两步框架,用于多模态卒中复发预测。研究针对多模态医学模型中常见的模态失衡问题——模型往往过度依赖主导模态而忽视互补信息,探讨了在3D CTA影像上进行自监督预训练能否减轻模态失衡并改善跨模态整合。作者对两个多模态神经网络进行自监督预训练,并采用两种不同的参数冻结策略进行微调,将其性能与模态利用情况同既有基线及完全从零训练的模型进行比较。结果显示,自监督预训练能更有效地利用影像与表格组成的多模态数据,性能优于先前基线和所有未预训练模型;其中表现最佳的基于Vision Transformer的网络成功克服了单模态坍缩。协同分析进一步揭示了视觉信息与性别、冠心病之间的显著交互作用,提示了具有临床意义的卒中复发模式。研究表明,自监督预训练配合策略性微调有助于实现更均衡的模态利用和有意义的跨模态交互,代码已公开。
| 多模态卒中复发预测 | 利用临床表格数据和医学影像等多种模态信息预测卒中患者复发风险的任务。 |
| 模态不平衡 | 多模态模型中某些模态因数据质量或数量优势被过度依赖,而其他模态贡献不足的现象。 |
| 自监督预训练 | 无需人工标注,通过设计辅助任务从数据本身学习通用表征的预训练方法。 |
| Vision Transformer (ViT) | 一种将图像分割为块序列并使用Transformer架构进行视觉特征提取的神经网络模型。 |
| 单模态崩溃 | 多模态模型在训练中退化为仅依赖单一模态进行预测,而忽略其他模态信息的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅