MedTVL首创三模态融合!时间+视觉+语言协同诊断,多数据集全面碾压现有方法
MedTVL: Harnessing Vision and Language for Medical Time Series Classification
arXiv AI (cs.AI) 重要 多模态医疗 🕐 09-01 12:00

📖 AI 总结

该研究提出了一种名为MedTVL的医学时间序列分类新框架,旨在整合时间序列、视觉和语言三种模态信息以提升临床决策支持能力。现有方法多聚焦于双模态交互,而MedTVL通过双路径架构实现三模态协同:卷积时间路径捕捉原始数值序列的细粒度动态特征,Transformer视觉路径分析由时间序列生成的图像以获取整体形态结构,同时引入医学文本语义作为自适应引导以缓解诊断歧义。此外,模型采用专家混合机制动态分配样本至特定融合专家,并支持多模态对比学习以应对临床标签稀缺问题。在多个医学数据集上的监督、少样本及对比学习实验表明,MedTVL在分类性能和可迁移性方面均优于现有方法,为多模态医学时间序列分析提供了新思路。

🔑 关键词速览

MedTVL一种文本引导的双路径架构,用于医学时间序列分类,结合时间、视觉和语言模态。
医学时间序列(MedTS)医疗领域中按时间顺序记录的数值数据,如心电图、脑电图等,用于临床诊断。
多模态学习利用多种数据类型(如数值、图像、文本)进行模型训练,以提高任务性能。
专家混合(Mixture-of-Experts)一种动态路由机制,根据输入样本选择性地激活不同的专家子网络,以增强模型适应性。
对比学习一种自监督学习方法,通过拉近相似样本、推开不相似样本来学习有效表示,缓解标签稀缺问题。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅