SCOUT 研究的是在合成数据训练、真实图像检索的“仿真到现实”场景下,能否用冻结编码器系统替代昂贵的微调交叉编码器来完成基于文本的行人检索。该方法将跨模态检索转化为嵌入空间预测:用可训练预测器把冻结视频编码器(V-JEPA)的 patch token 映射到冻结文本编码器(EmbeddingGemma)的嵌入空间,以双向 InfoNCE 为目标,基础模型不微调任何编码器。研究有三项发现:一是最佳冻结文本编码器取决于其几何结构与视频特征的匹配程度,一种免训练对齐分数对三个候选编码器的排序与检索准确率完全一致;二是针对精度的两个手段——视频编码器的 ExPLoRA 参数高效适配和基于视觉语言模型的免训练属性分解重排器——可提升首位精度,带来 2.2 个百分点的 R@1;三是本地与公开校准研究解释了哪些干预能迁移到真实域。在 AI City Challenge 2026 Track 4 上,完整检索—融合—重排系统达到 84.25 mAP@10,单模型提交为 60.63,训练成本约 95 GPU 小时。
| Sim-to-Real Gap | 模拟到现实的差距,指在合成数据上训练的模型在真实数据上性能下降的问题。 |
| Frozen Encoder | 冻结编码器,指在训练过程中参数保持不变的预训练模型,用于特征提取。 |
| InfoNCE | 一种对比学习损失函数,通过最大化正样本对相似度、最小化负样本对相似度来学习表示。 |
| ExPLoRA | 一种参数高效微调方法,通过低秩适应和提示学习来调整预训练模型。 |
| mAP@10 | 平均精度均值(前10个结果),衡量检索系统在前10个返回结果中的平均精度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅