白阳 万洪林 白成杰



摘要:在对GoogLeNet模型分析的基础上,通过Caffe平台上使用开源GoogLeNet模型,对Stanford40静态图像集中人体行为进行分类研究,得到top-5准确率为50.23%,这些工作对深入理解GoogLeNet模型和静态图像中人体行为分类的研究有所帮助。
关键词:人体行为分类;GoogLeNet;静态图像
中图分类号:TP18 文献标识码:A 文章编号:1009-3044(2017)18-0186-03
1概述
在静态图像索引和检索中,人体行为分类有许多潜在的应用。目前,对静态图像中人体行为的分类已有很多研究。有些方法是用整幅图片直接进行分类,如基于空间金字塔法、随机森林法等构建的分类器;有些方法是利用对象与人之间的相互作用或者是人体的姿态进行分类;还有些方法是利用整体和局部属性进行识别。随着深度学习的发展,卷积神经网络作为一种深度学习框架,通过卷积运算来由浅人深的提取图像不同层次的特征,且整个网络可以自动调节卷积核的参数,从而无监督的产生最适合的分类特征,取得较好的分类效果,使卷积神经网络成为当前图像识别领域的研究热点和发展趋势。
1998年,纽约大学教授Yann LeCun开发了一套能够识别手写数字的系统LeNet,这是卷积神经网络第一次用于解决实际问题。2012年,Geoffrey和Alex在ILSVRC竞赛中提出AlexNet模型,并赢得冠军。2014年ILSVRC挑战赛由Google团队提出的一种深度卷积神经网络架构GoogLeNet模型夺得冠军。随着卷积神经网络结构的不断增强,其处理的问题也可以相应变得更加复杂,本文实验使用GoogLeNet模型来测试对静态图像中人体行为的分类效果,并加以分析。……