本文提出了一种名为DESA-TTA的新型测试时自适应方法,旨在解决视觉语言目标检测器在部署中面对分布偏移时的脆弱性问题。现有均值教师TTA方法依赖固定EMA系数,且反复优化易导致学生模型累积漂移。DESA-TTA通过动态时间平均和源锚定两项低开销机制,分别调节教师更新和学生漂移:前者根据伪标签置信度和框密度估计教师不确定性,动态选择样本级EMA系数;后者按学生漂移程度逐步将参数拉回预训练值。实验表明,该方法在多种分布偏移场景和两种VLOD架构上均优于现有TTA方法,在VOC-C上AP50较零样本推理提升14.5个百分点,推理吞吐量较此前最优方法提高55%。该研究为检测器在真实场景中的稳健部署提供了高效解决方案。
| Vision-language object detectors (VLODs) | 视觉语言目标检测器,结合视觉和语言信息进行目标检测的模型。 |
| Test-time adaptation (TTA) | 测试时自适应,在测试阶段调整模型以适应分布偏移的技术。 |
| Mean-teacher method | 均值教师方法,一种使用教师模型生成伪标签来更新学生模型的自适应技术。 |
| Exponential moving average (EMA) | 指数移动平均,一种对参数进行平滑更新的技术,常用于教师模型的更新。 |
| Source anchoring | 源锚定,一种将模型参数部分恢复至预训练值以抑制漂移的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅