李宝奇 黄海宁 刘纪元 刘正君 韦琳哲
(中国科学院声学研究所 北京 100190)
(中国科学院先进水下信息技术重点实验室 北京 100190)
合成孔径声呐 (Synthetic Aperture Sonar,SAS)是一种高分辨率水下成像声呐,其基本原理是利用小孔径基阵的移动形成虚拟大孔径,从而获得方位向的高分辨率。与普通侧扫声呐相比,SAS 最为显著的优点是方位向分辨率较高,且理论分辨率与目标距离以及采用的声波频段无关[1,2]。合成孔径声呐图像目标检测任务在水下无人平台自主导航和搜索发挥着重要作用[3,4]。考虑水下目标尺寸的多样性,即合成孔径声呐图像中目标的尺度差别较大,这会进一步增加目标检测的难度。
通过将深度学习[5—7]模型卷积神经网络 (Convolutional Neural Networks,CNN)[8—10]嵌入到目标检测模型之中,目标检测精度在过去几年中不断提高,结合CNN的目标检测算法可分为基于候选区域和基于回归两类。基于候选区域的算法主要有RCNN(Region-based Convolutional Neural Networks)[11],Fast R-CNN[12]和Faster R-CNN[13,14]等,此类算法检测速度有待提高。为了提高模型的检测速度,一些研究者开展了无区域建议的目标检测研究,主要采用回归的思想。Redmon等人[15]提出了一种无区域建议的目标检测模型YOLO (You Only Look Once)。YOLO 通过采用空间限制,大大提高了效率,能够达到实时的效果。但是YOLO的检测精度不如Faster R-CNN。针对YOLO存在的不足,Liu等人[16]提出SSD (Single Shot Detector)模型。SSD通过融合6个尺度的特征来提高目标检测的精度。虽然SSD单幅图像检测精度比YOLO有大幅的提高,不过检测速度依然较慢。为了缩短SSD的检测时间,Iandola等人[17]提出了基于FireModule的轻量化SqueezeNet网络。FireModule主要是利用1×1的卷积层对输入特征降维来降低模型的参数和计算量,同时也利用Inception[18]结构提高FireModule的特征提取能力。……