该综述系统梳理了多模态异常检测(MMAD)领域的研究进展,提出从“假设驱动”视角重新组织现有工作。文章首先形式化MMAD问题,识别出五个核心挑战的内在特征,并将已有方法划分为两大互补范式:一是基于正常性假设的方法,通过表征学习、跨模态对齐和知识增强来建模常规模式;二是基于异常性假设的方法,利用粗粒度、结构化和语义级异常注入来锐化决策边界。此外,综述探讨了基础模型如何通过可扩展预训练、灵活跨模态迁移和推理能力重塑MMAD,并汇总了跨领域的基准数据集与评估协议。文章最后指出,构建鲁棒、自适应且可解释的MMAD系统仍是未来关键方向。该工作为理解MMAD方法谱系提供了新框架,有助于推动该领域在工业检测、网络安全等安全关键场景中的进一步发展。
| Multi-Modal Anomaly Detection (MMAD) | 多模态异常检测,从多种数据源(如图像、文本、传感器)中识别罕见异常事件的技术。 |
| normality-assumption methods | 正态性假设方法,通过建模正常数据的规律性来间接检测异常。 |
| anomaly-assumption methods | 异常假设方法,通过注入或模拟异常来直接学习异常模式,以锐化决策边界。 |
| foundation models | 基础模型,如大规模预训练模型,通过可扩展预训练和跨模态迁移能力提升MMAD性能。 |
| cross-modal alignment | 跨模态对齐,将不同模态的数据映射到共享表示空间以捕捉一致性或差异性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅