张学军,周 云,杜 丹,郑 威,王文帅,张丙克
(1.中国电子科技集团公司第五十四研究所,河北 石家庄 050081;2.陆军装备部驻石家庄地区第一军代室,河北 石家庄 050081;3.中国人民解放军73602部队,江苏 南京 211100)
不同于手工特征提取方法,使用深度卷积神经网络能够自动提取图像的表观特征[1]。然而不同的算法提取到的特征表征能力不同,最终的特征表征能力越强,越能反映视频中所发生的动作,模型算法识别准确率越高,因而构建一个表征能力强的特征成为计算机视觉领域中算法关键研究点。
在计算机视觉的目标检测任务中,模型需要对图像中不同大小的物体进行检测定位,通过观察可知单发多框检测(SSD)方法能够很好地解决这一问题[2]。SSD算法属于目标检测方法中的“一步式”方法,不同于“两步式”方法,“一步式”方法不需要提取计算候选区域,其特征提取与目标位置回归整合到卷积神经网络中,因而在速度上有很大的优势。SSD使用多尺度特征直接进行目标的位置回归和分类。在卷积过程中得到的特征图尺寸不一,大尺寸的特征图还包含丰富的底层表观信息,可用于检测一些细小的物体[3]。小尺寸的特征图经过多层的卷积操作,包含更为抽象的语义信息特征,可用于检测更为宏观的物体。SSD的模型框架如图1所示。

图1 SSD模型框架Fig.1 SSD model framework
SSD模型使用VGG16-SSD模型训练自己的数据集做识别,在VGG16基础上取消其最后两层全连接层,增加了额外的卷积层以获取更多不同尺寸的特征图。……