该研究聚焦于合成孔径声呐(SAS)图像中的自动目标识别(ATR)任务,系统比较了现代卷积神经网络(CNN)与基于Transformer架构的深度神经网络在该场景下的性能表现。研究发现,尽管Transformer在通用计算机视觉领域已占据主导地位,但在SAS-ATR文献中应用较少。作者通过实验探究了网络规模、架构类型、预训练方法、数据增强及正则化策略等因素对识别精度的影响,旨在克服标注训练数据稀缺的挑战。研究不仅致力于构建性能最优的识别模型,还提出了训练先进SAS-ATR模型的系统路线图。该工作为声呐图像目标识别领域提供了架构选择与训练配置的实证依据,有助于推动该技术在海底探测等实际应用中的效能提升。
| Synthetic Aperture Sonar (SAS) | 合成孔径声纳,一种利用声波合成大孔径以获取高分辨率水下图像的技术。 |
| Automatic Target Recognition (ATR) | 自动目标识别,指自动从图像或信号中检测和分类目标物体的技术。 |
| Convolutional Neural Network (CNN) | 卷积神经网络,一种擅长处理网格状数据(如图像)的深度学习架构。 |
| Transformer | 一种基于自注意力机制的深度学习架构,在自然语言处理和计算机视觉中表现优异。 |
| Data Augmentation | 数据增强,通过对训练数据进行变换(如旋转、缩放)来增加数据多样性以提升模型泛化能力的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅