多模态AI识别矛盾情绪准确率飙升10个点,单卡20分钟训练刷新纪录
Modality Discrepancy Transformer for Ambivalence and Hesitancy Recognition
arXiv CL (cs.CL) 多模态论文方法 🕐 09-18 12:00

📖 AI 总结

本文提出模态差异Transformer(MDT),用于识别临床视频中个体在面部、声音和语言渠道间表现出矛盾信号的矛盾与犹豫(A/H)情感状态。该方法基于冲突感知多模态融合框架,将原有6令牌设计扩展为9令牌表示,包含三种模态嵌入、三种绝对差异特征和三种通过线性投影学习的哈达玛积差异特征,经Transformer自注意力处理,并引入FiLM文本条件调制与LoRA微调,推理阶段采用文本引导的晚期融合分支。在第三届ABAW挑战赛BAH数据集上,MDT在标注测试集取得0.7408宏F1,在私有排行榜取得0.7368,较最强已发表基线提升逾10个点,且单GPU训练时间不足20分钟。该工作表明显式建模跨模态分歧可有效提升矛盾与犹豫识别性能。

🔑 关键词速览

矛盾与犹豫(A/H)一种情感状态,个体在面部、声音和语言等不同模态中表达出相互矛盾的信号。
模态差异Transformer(MDT)本文提出的模型,通过扩展令牌表示和自注意力机制来捕捉跨模态不一致性,用于识别矛盾与犹豫。
冲突感知多模态融合一种融合多模态信息的方法,旨在保留而非抑制模态间的冲突信号。
FiLM特征级线性调制,一种通过条件信息对神经网络中间特征进行仿射变换的技术。
LoRA低秩适应,一种参数高效的微调方法,通过低秩分解减少可训练参数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅