朱 郝,杨世恩,陈春梅
(1.西南科技大学 计算机科学与技术学院,四川 绵阳 621010;2.西南科技大学 信息工程学院,四川 绵阳 621010)
目标检测是计算机视觉领域的热门研究方向,经过数十年的发展,在生活中得到了广泛的运用,例如监控安全、人脸检测、自动驾驶等。目前,现有的主流图像目标检测算法可以分为两类:一类是二阶段的检测算法,先由算法生成一系列作为样本的候选框,再通过卷积神经网络进行样本分类,检测精度较高,检测速度较慢,如RCNN、Fast R-CNN、Faster R-CNN等;另一类是一阶段的检测算法[1],只需一次提取特征即可实现目标检测,其速度相比二阶段的算法快,但检测精度会有所下降,如SSD、YOLO系列等;其中基于一阶段的YOLO系列目标检测算法最具有代表性,因其较好的综合性能,逐渐成为大多数实际应用的首选框架。
由于基于卷积神经网络的图像处理算法相较于传统的算法[2],具有更好的鲁棒性,于是越来越来多的研究者提出了更具有表征能力的深层网络,使得模型变得越来越复杂。尽管复杂的模型能够提供更高的精度,但也产生了一些问题:模型复杂度高,占用大量计算资源,不利于算法的落地应用。于是相关工作[3-5]利用骨干网络替换、深度可分离卷积、网络剪枝等方法减少模型的参数量(Parameter Count)和浮点运算量(FLOPs),达到网络轻量化的目的。但上述两种度量指标并没有考虑内存的访问成本和并行度,可能会对模型的推理速度产生较大的影响。为了进一步提高模型的推理速度,于是有了结构重参数化(structural re-parameterization technique)相关工作,如RepVGG[6-8]等。……