该研究提出了一种名为Vis-Dict的字典式方法,用于解决社交媒体抑郁症检测中图像模态缺失的问题。传统多模态模型依赖文本与图像结合,但许多帖子缺少图像,现有填补方法需额外训练生成或检索模型。Vis-Dict通过将词语与完整训练帖子中的平均图像向量关联,直接构建缺失的视觉特征,再与文本结合追踪用户行为变化。在包含最多512条帖子的用户时间线数据集上测试,Vis-Dict达到了0.9454的F1分数和0.9890的ROC-AUC,性能与生成式网络相当,且图像生成部分无需任何可训练参数。结果表明,将词语直接映射到视觉特征是一种高效实用的缺失图像处理策略,为抑郁症检测系统提供了轻量级解决方案。
| Vis-Dict | 一种基于字典的方法,通过词语与平均图像向量的映射来填补缺失的视觉特征。 |
| 多模态模型 | 同时处理文本和图像等多种数据类型的模型,用于提高检测准确性。 |
| 缺失模态插补 | 在数据不完整时,估计或生成缺失的模态(如图像)以支持多模态分析。 |
| F1分数 | 精确率和召回率的调和平均值,用于评估分类模型的性能。 |
| ROC-AUC | 受试者工作特征曲线下的面积,衡量模型区分正负类的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅