邵江南,葛洪伟
(1. 江南大学 江苏省模式识别与计算智能工程实验室,江苏 无锡 214122; 2. 江南大学 物联网工程学院,江苏无锡 214122)
随着计算机视觉领域的发展,目标跟踪在人机交互、视频监控、自动驾驶和机器人等领域得到越来越多的重视和应用。早期的跟踪模型常见的有粒子滤波[1]、Mean shift[2]、相关滤波[3]及其衍生模型[4-8]等。虽然这些传统的跟踪器经过近年来的发展在精度和速度上都有了明显提升,但是对目标特征的提取仍以光流、外观形状、颜色等浅层特征为主,不能捕捉目标语义特征,难以在面对长时跟踪时目标外观形变、被遮挡或出视野等情况下保持鲁棒跟踪。而随着深度学习在跟踪领域的发展,这些问题正逐渐得到改善。
基于深度学习的跟踪器,能有效利用目标的深度特征对目标进行语义级抽象,并拟合目标的运动过程,这大大提高了跟踪精度;且模型的特征提取器在离线时得到了大量标记图片的端到端预训练,这进一步提高了跟踪器在线跟踪速度,使深度学习在目标跟踪领域的应用成为可能。由于目标检测与目标跟踪具有相似性,检测领域的很多算法思想都逐渐被应用于跟踪:MDNet[9]在前一帧的目标周围高斯采样出大量候选框,再利用预训练的二分类器区分候选框中的目标和背景,从而定位目标位置;SiamFC孪生网络模型[10]利用同样结构的CNN(convolutional neural network)网络对初始帧目标和当前帧搜索域提取深度特征,然后通过卷积操作进行相似性计算,得到目标在搜索域位置的响应;……