张一杨 姚明林
(唐山学院 河北 唐山 063000)
对公共场所的突发事件实时安全监控,有益于提高人民生活质量,而开始受到越来越高的重视,因此针对声音事件的精确检测和准确识别对辅助公共安全监控具有重要的研究意义[1]。
借鉴语音信号检测领域的研究成果,已有算法大多提取信号的MCFF[2]、短时能量谱[3]、相关系数、声谱图[4]、ESMD排列熵[5]、多频带能量[6]及稀疏合成NMF[7]等特征,或通过α分布分析[6]、T分布[7]减少环境噪声对特征干扰,然后借助k-近邻、混合高斯模型、SVM及DNN网络[4]等传统分类器及其组合模式实现对环境噪声中异常声音信号的检测和识别。虽然取得较好的识别效果,但上述算法往往需要大样本量支撑训练[2]及存在阶数难以合理设置[3]、多隐层错误[5]等问题,且公共场所的强背景噪声对已有算法的特征提取和检测识别存在较强的干扰。
随着深度学习的兴起,深度神经网络也被应用于处理环境声音识别分类问题[8-11]。冯陈定等[8]基于改进深度学习卷积网络,以堆叠递减卷积核提取多尺度归一化局部特征,以动态学习率提高算法的收敛速度与稳定性,取得了更好的识别率。史秋莹等[9]以三隐层深度神经网络对声信号的MCFF特征进行识别,取得了比SVM和GMM更好的识别结果[10-11]。深度学习网络相比于传统分类器提高了异常声信号的检测精度,但其庞大的参数需求、复杂的参数设置及计算需求,使得在实际应用中,需要对其做进一步的优化和改进。
匹配追踪(Matching Pursuit,MP)无需先验信息而实现信号的稀疏分解和降噪,对非平稳环境下的噪声干扰具有较好的适应性。……