王恩德,,3, ,3
(1.中国科学院沈阳自动化研究所,沈阳 110016;2.中国科学院光电信息处理重点实验室,沈阳 110016; 3.东北大学 信息科学与工程学院,沈阳 110819)
虽然对静态图像的行为识别研究起步的较晚,但是却有很多不错的研究成果出现。目前主要分3类研究方法:基于图像整体的行为识别,基于人的姿势的行为识别以及基于人和物体之间交互关系的方法。早期的静态图像的行为识别主要对整张图像提取底层特征,如方向梯度直方图(Histogram of Oriented Gradients,HOG)、通用搜索树(Generalized Search Trees,GIST)等特征,然后将这些底层特征输入到分类器中进行分类,且目前图像分类比较好的方法主要有特征词袋(Bag of Words,BOF)和空间金字塔匹配(Spatial Pyramid Matching,SPM)[1-2]。
国内关于人体行为分类的文献比较少,不过大部分研究还是集中在提取底层特征、中层特征以及高层特征方面。除此之外,部分研究人员利用深度学习的方法[3]对人体行为进行分类。可以实现比较好的分类效果,不过如果卷积层太多的情况下,时间复杂度和计算复杂度会增加。
有些学者通过研究人和周围物体的交互来实现不同行为的分类,实现了比较好的识别效果[4-5]。文献[6]使计算机能够区分出图像中人是在演奏乐器还是只是拿着乐器。在解决这个问题的过程中,作者认为拿着乐器和演奏乐器,属于不同的行为但是交互的物体却是相同的,例如当演奏小提琴的时候人和物体的交互位置主要集中在图像的上部分区域(人的肩膀的位置),而在拿着小提琴的时候交互位置却集中在下部分区域。……