融入注意力机制的深度学习动作识别*

2021-11-02 01:25:06张宇,张雷
电讯技术 2021年10期
关键词:动作特征模型

张 宇,张 雷

(北京建筑大学 电气与信息工程学院,北京 100044)

0 引 言

动作识别[1]的目标是判断视频中人体正在执行的动作,其作为计算机视觉的一项基本而又极富挑战性的任务,在智能家居[2]、智能安防[3]、人机交互[4]、视频检索[5]等众多领域有着广阔的应用前景。

早期的动作识别研究中,国内外学者设计了多种手工特征,并进行了大量实验,如轮廓剪影、人体关节点、时空兴趣点、运动轨迹等。由于依赖人工特征提取,其抗扰性和泛化能力都较差,无法得到广泛应用[6]。相比之下,深度学习方法能够自主学习数据特征,并且更加高效准确[7]。因此,基于深度学习的特征提取方法逐渐取代了人工提取特征的过程。Ji等人[8]第一次提出了3D-CNN算法,对时间轴上的视频帧运用3D 卷积核来捕捉时空信息,并将其用于人体动作的识别。Tran等人[9]提出了C3D 网络,并将其用于动作识别、场景识别、视频相似度分析等领域。Carreira等人[10]将2D卷积膨胀为了3D卷积,形成了膨胀3D卷积网络I3D。Donahue等[11]提出了LRCN(Long-term Recurrent Convolutional Network)模型,该网络用卷积神经网络(Convolutional Neural Network,CNN)提取特征,再用长短时记忆(Long Short-Term Memory,LSTM)网络实现动作分类。在动作识别中,CNN与LSTM的使用,很大程度上提高了识别精度,减少了工作量。然而,随着CNN加深,将出现严重的梯度消失和网络退化问题。为了解决该问题,本文采用由卷积注意力模块[12](Convolutional Block Attention Module,CBAM)和残差网络[13](ResNet)构成的注意力残差网络提取特征,然后再利用LSTM进行动作分类。

此外,目前动作识别的难点主要有:视频动作样本较少,训练过程易出现过拟合;视频中存在许多冗余帧,易对模型产生干扰;……

登录APP查看全文

猜你喜欢
动作特征模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
动作描写要具体
动作描写不可少
3D打印中的模型分割与打包
非同一般的吃饭动作
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15