高玮军,师 阳,杨 杰,张春霞
兰州理工大学 计算机与通信学院,兰州730050
随着人口数量的增多,尤其是在商场、火车站等人口密集的公共区域,容易引起人员拥堵、推搡踩踏等安全事故。通过视频监控实时统计公共场所的人数,政府部门可以及时安排公安消防等人员对人流进行疏散和引导,可以有效预防及减少突发性的安全问题。
现有的密集人数统计方法概括为以下两种实现途径[1]:基于回归的人数统计方法和基于检测的人数统计方法。
一种常用的人数统计方法是基于输入图像预测密度图训练回归模型,以像素为单位取整个密度图的总和来预测最终人数。Zhang等[2]设计了一种简单有效的多列卷积神经网络MCNN,从任意密度和任意视角准确估计单幅图像中的人数。Li 等[3]设计了一个更深的网络CSRNet,引入膨胀卷积层作为后端部署,以扩大感受野并提取更深的特征。Jiang等[4]提出的基于Trellis编解码器网络TEDNet。这些算法已经取得非常好的结果,但缺点是对于输入图像的分辨率非常敏感,且不考虑密度映射中计数贡献来自何处的位置,无法精准定位。
另一种常用的人数统计方法是基于检测的方法。将图像直接输入到经过预先训练的目标检测框架中进行分类,计算出类别为人的边界框数量,以获得最终的人数。现有的检测算法分为以下两大类:一类是两阶段检测算法,典型代表为R-CNN[5]、Fast-RCNN[6]、Faster-RCNN[7]等;另一类是一阶段检测算法,典型代表为SSD[8]、YOLO[9]等。但是通过检测统计人数通常将整个人体作为检测对象,由于高矮不一、胖瘦不均等原因,在人口密集的公共区域很容易出现高遮挡情况导致检测结果不佳。……