该研究针对合成孔径声呐自动目标识别中深度学习受限于目标图像稀缺、背景杂波强及人工介入评估的问题,提出一种三阶段参数高效适配框架,将DINOv3视觉Transformer迁移至水下声学场景。第一阶段采用低秩适配并冻结主干,弥合自然图像预训练与水下声传播之间的差距;第二阶段引入难负样本挖掘以增强对岩石、沉积物等声学仿冒目标的判别边界;第三阶段使用监督对比学习分离目标与杂波表征。基于海上实测数据、按任务级地理划分评估,结果显示LoRA是主要增益来源,在相同冻结主干下将AUPRC从0.300提升至0.679±0.027,且秩为4时仅训练0.26%的权重。两个精炼阶段均未超过对照:难负样本挖掘相对等量随机课程变化为-0.0045±0.0119,监督对比学习相对前一阶段仅+0.0002±0.0096。这表明挖掘发生在编码器已拟合的数据上,监督阶段已基本确立目标与杂波的几何结构,单一高效适配阶段即足够,堆叠式精炼并无必要。
| 合成孔径声纳 (SAS) | 一种利用小孔径声纳沿航迹运动合成大孔径,从而获得高分辨率水下图像的技术。 |
| 低秩适应 (LoRA) | 一种参数高效微调方法,通过向预训练模型注入低秩矩阵来适应新任务,同时冻结原始权重。 |
| 视觉Transformer (ViT) | 一种将图像分割为块序列并应用Transformer架构的深度学习模型,在计算机视觉任务中表现优异。 |
| 监督对比学习 (SupCon) | 一种利用标签信息拉近同类样本、推开不同类样本的对比学习框架,用于学习判别性表示。 |
| 精确率-召回率曲线下面积 (AUPRC) | 评估不平衡数据集分类性能的指标,综合了精确率和召回率在不同阈值下的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅