胡德生,张雪英,张 静,李宝芸
(太原理工大学 信息与计算机学院,太原 030024)
语言是人类交流最方便、最快捷的方式,语言中包含的情感信息在交流时发挥着重要作用。让机器像人一样具备说话、思维和情感能力,是人工智能领域一直追求的目标。语音情感识别的研究,将推动这一目标的逐步实现。
典型的语音情感识别模型由语音情感数据库、特征提取和识别3部分组成[1],提取有效情感特征是语音情感识别的关键。传统的语音情感识别首先分帧提取Mel频率倒谱系数(Mel frequency cepstral coefficients,MFCC)等声学特征,然后提取所有帧的最大值、最小值、均值、方差等统计特征作为语音信号的全局特征[2-4]。由于全局特征是在句子级别上提取统计特征,所以其只能粗略反映语音情感随时间变化的特性。针对这个问题,段特征的概念被提出,首先将语音信号分段,每段包含若干帧语音,对这若干帧语音各自提取声学特征后,再计算这段语音的多个统计特征作为段特征。文献[2]将段特征直接输入基于注意力机制的长短时记忆单元(long short-term memory,LSTM)网络提取深度特征并分类,与全局特征相比取得了较好的效果。
语谱图是一维语音信号在二维时频域的展开,能够充分反映语音信号在时频域大部分信息。卷积神经网络(convolutional neural networks,CNN)由于其自动学习特征的能力和适用于二维图像数据的特点,目前被广泛用在语谱图中提取特征,进一步提高语音情感识别性能[5-8]。如文献[8]先将语谱图输入全卷积网络(fully convolutional networks,FCN),并在最后……