本文提出模态差异Transformer(MDT),用于识别临床视频中个体在面部、声音和语言渠道间表现出矛盾信号的矛盾与犹豫(A/H)情感状态。该方法基于冲突感知多模态融合框架,将原有6令牌设计扩展为9令牌表示,包含三种模态嵌入、三种绝对差异特征和三种通过线性投影学习的哈达玛积差异特征,经Transformer自注意力处理,并引入FiLM文本条件调制与LoRA微调,推理阶段采用文本引导的晚期融合分支。在第三届ABAW挑战赛BAH数据集上,MDT在标注测试集取得0.7408宏F1,在私有排行榜取得0.7368,较最强已发表基线提升逾10个点,且单GPU训练时间不足20分钟。该工作表明显式建模跨模态分歧可有效提升矛盾与犹豫识别性能。
| 矛盾与犹豫(A/H) | 一种情感状态,个体在面部、声音和语言等不同模态中表达出相互矛盾的信号。 |
| 模态差异Transformer(MDT) | 本文提出的模型,通过扩展令牌表示和自注意力机制来捕捉跨模态不一致性,用于识别矛盾与犹豫。 |
| 冲突感知多模态融合 | 一种融合多模态信息的方法,旨在保留而非抑制模态间的冲突信号。 |
| FiLM | 特征级线性调制,一种通过条件信息对神经网络中间特征进行仿射变换的技术。 |
| LoRA | 低秩适应,一种参数高效的微调方法,通过低秩分解减少可训练参数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅