该研究提出了一种名为失真扩展器(DEX)的方法,旨在将视觉基础模型从透视图像泛化到鱼眼相机图像。由于鱼眼图像存在径向畸变,直接迁移模型会导致深度估计和开放词汇分割等任务的性能显著下降。DEX通过一组可学习参数建模畸变系数及鱼眼与透视图像在潜在空间中的分布差异,并利用自监督对齐损失将鱼眼图像的嵌入变换为接近透视图像的表示,从而恢复高保真输出。该方法与具体架构和任务无关,在卷积和Transformer架构上均验证了有效性,并在室内外鱼眼数据集上持续优于基线。此外,DEX的激活值还可解码为畸变系数,辅助相机标定。该工作为宽视场视觉任务提供了一种通用且实用的解决方案。
| Vision Foundation Models | 在大规模数据上预训练的通用视觉模型,可适应多种下游任务。 |
| Distortion Extenders (DEX) | 一组可学习参数,用于建模鱼眼畸变并调整潜在表示以匹配透视图像。 |
| Covariate Shift | 训练和测试数据分布不一致导致的模型性能下降现象。 |
| Open-Vocabulary Segmentation | 能够分割任意类别(不限于预定义类别)的图像分割任务。 |
| Self-Supervised Alignment Loss | 无需人工标注,通过对比或一致性约束来对齐不同数据表示的训练损失。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅