多模态分类新突破:树集成模型性能超Transformer,准确率提升4.3%还自带人类可懂解释!
Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles
arXiv AI (cs.AI) 重要 多模态论文方法 🕐 08-24 12:00

📖 AI 总结

该研究提出了一种基于线性判别树集成框架的多模态分类方法,旨在平衡预测精度与模型可解释性。针对Transformer等模型在情感和行为识别中难以提供可理解特征权重的问题,作者将文本、音频和视觉模态编码为令牌,通过概念提取与聚类降维,再经树集成分类器融合,并引入改进的特征重要性度量以削弱二分类中负类影响。实验表明,线性判别树、森林及AdaBoost变体在F1-mod上较多模态Transformer提升4.3%,准确率较可解释基线IMR提升3.0%;所提特征重要性在IEMOCAP和CMU-MOSI数据集上的人工标注一致性分别达62.2%和46.7%,显著高于默认方法的43.2%和32.1%。该框架为临床情感监测等信任敏感场景提供了兼顾性能与可解释性的实用方案。

🔑 关键词速览

Linear Discriminant Tree (LDT)一种基于线性判别分析的决策树模型,用于分类任务,结合了线性判别和树结构的可解释性。
Multimodal Transformer一种基于Transformer架构的多模态模型,用于融合文本、音频和视觉信息,但可解释性较差。
Interpretable Multimodal Routing (IMR)一种可解释的多模态路由方法,作为基线模型,用于比较可解释性性能。
Feature Importance特征重要性,用于衡量每个特征对模型预测的贡献程度,本研究中被修改以提高可解释性。
F1-mod一种改进的F1分数,用于评估分类性能,特别适用于不平衡数据集。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅