该综述系统梳理了多模态面部状态分析这一研究方向,指出传统单一视觉方法受环境敏感性和可解释性不足的制约,而融合视觉、音频、文本、生理信号等多种模态的互补信息可有效弥补上述缺陷。文章围绕面部表情识别、动作单元检测和面部软生物特征估计三大核心任务,总结了代表性方法与数据集,并强调两条关键主线:一是多模态学习借助语言提供的上下文语义增强面部状态推理能力,并通过可解释的语言生成提升模型透明度;二是多任务学习可同时分析表情、动作单元与年龄性别等属性,捕捉细粒度表情变化并改善跨场景泛化性能。该综述为多模态、可解释、多任务自适应的面部状态分析提供了最新文献概览,并指出了未来研究方向。
| 多模态面部状态分析 | 整合视觉、音频、文本、生理等多种模态信息来综合分析面部状态的方法。 |
| 动作单元(AUs) | 面部肌肉运动的基本单位,用于精细描述面部表情变化。 |
| 基于面部的软生物特征 | 从面部图像中估计的年龄、性别等非刚性生物特征。 |
| 多任务学习 | 同时学习多个相关任务(如表情识别、AU检测、软生物特征估计)以提升泛化能力。 |
| 可解释性 | 模型能够以人类可理解的方式(如自然语言)解释其决策过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅