120万住院数据预训练,心脏多模态AI性能碾压单模态基线!
Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning
arXiv AI (cs.AI) 重要 #多模态#医疗AI#自监督学习 🕐 09-14 12:00

📖 AI 总结

该研究针对心血管诊断中多模态数据(如心电图、超声心动图、胸片和临床变量)整合不足的问题,提出了潜注意力掩码自编码器(LAMAE)。现有医学基础模型多局限于单一模态,仅在微调或后训练阶段进行模态融合,既丢失了临床医生自然整合的跨模态证据,也忽视了各模态内部的结构信息。LAMAE是一种多模态、结构感知的掩码自编码器,在自监督预训练阶段通过共享的潜注意力模块,在“检查—视图—实体”层级上直接于潜空间交换信息,从而联合学习患者级表征,并能聚合可变观测、优雅处理模态缺失。该模型在超过120万次MIMIC-IV住院记录上预训练,在多模态住院任务(如院内死亡率、ICD-10与DRG编码、住院时长)上优于模态特异性预训练及强对比学习和视觉语言基线,在单模态任务上亦具竞争力。即使在测试时仅有一种模态可用,性能增益依然存在,表明同时建模模态内与模态间结构可产生更稳健、可迁移的表征。

🔑 关键词速览

Latent-Attention Masked Autoencoders (LAMAE)一种多模态、结构感知的掩码自编码器,通过共享潜在注意力模块在潜在空间交换信息,联合学习患者级表示。
Masked Autoencoder一种自监督学习方法,通过随机掩码输入的一部分并重建来学习数据的有效表示。
Multimodal Cardiac Representation Learning利用多种模态数据(如ECG、超声等)学习心脏相关特征表示的过程。
MIMIC-IV一个大型公开的重症监护医学数据库,包含大量住院患者的多模态临床数据。
Study-View-Entity Hierarchy一种用于组织医学数据的层次结构,将检查、视图和实体按层级关系排列,以捕捉模态内结构。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅