本文提出了一种名为DART的RGB-D预训练方法,旨在提升手术视觉基础模型的表征能力。传统自监督预训练仅依赖RGB图像,忽略了深度等互补信号,而手术场景中自然图像模型迁移效果差且几何信息丰富。DART基于DINOv2架构,引入像素级深度重建目标,利用现成模型生成的伪深度标签监督掩码补丁重建,深度仅在预训练阶段使用,微调和推理仍仅需RGB输入。实验表明,该像素级重建头能提升而非干扰表征质量,且深度目标优于Canny边缘等替代信号,证实增益源于几何信息本身。在涵盖分割、深度估计和图像级识别的八个手术基准上,DART优于自然图像和域内基线,包括在相同数据上训练的原始DINOv2,同时改善密集预测和图像级理解。该研究展示了免费几何伪标签可强化基础模型预训练,无需额外标注或推理成本,为手术领域更强骨干网络提供了新方向。
| Vision Foundation Models (VFMs) | 视觉基础模型,通过大规模预训练学习通用视觉表示,可迁移至多种下游任务。 |
| DINOv2 | 一种自监督视觉模型,利用自蒸馏和掩蔽图像建模学习高泛化能力的图像特征。 |
| RGB-D pretraining | 使用RGB图像和深度图联合进行预训练的方法,深度信息作为辅助监督信号。 |
| Pseudo-labeled depth | 由预训练模型自动生成的深度图标签,无需人工标注,用于监督学习。 |
| iBOT | 一种掩蔽图像建模方法,通过预测掩蔽补丁的视觉特征进行自监督学习。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅