该研究提出了一种名为TTSD-FAR的测试时自适应框架,用于解决大型视频语言模型(LVLMs)在多模态情感识别中因模态缺失或噪声导致的性能退化问题。该方法采用参数高效的自我蒸馏机制,由在完整模态上训练的冻结教师模型引导自适应低秩学生模型,仅更新极少量参数。同时,通过Fisher信息稳定性监测实现锚定恢复,在检测到分布漂移时将学生模型恢复至教师锚点,避免持续适应过程中的累积误差。在MELD、DFEW和BAH数据集上,针对0%-50%的模态缺失情况,实验表明该框架在长期适应中优于基于熵最小化、检索增强生成和困惑度降低的现有方法,且不会出现基线方法常见的渐进式性能退化,为多模态情感识别的实际部署提供了稳健解决方案。
| LVLMs | 大型视频语言模型,结合视频和文本信息进行多模态理解与生成。 |
| TTSD | 测试时自蒸馏,一种在测试阶段通过教师模型指导学生模型进行参数高效适应的框架。 |
| FAR | Fisher锚定恢复,通过监控Fisher信息稳定性检测分布偏移并恢复模型到可靠状态的方法。 |
| TTA | 测试时适应,在模型部署后根据测试数据动态调整模型参数以应对分布变化。 |
| RAG | 检索增强生成,通过检索外部知识库增强生成模型输出的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅