卢林,王东
(1.黄冈职业技术学院,湖北 黄冈 438002;2.中汽研(天津)汽车工程研究院有限公司,天津 300300)
声音识别技术中主要包含语音识别和环境声音识别,语音识别的出现让人类和机器的交流变得更加智能和便捷。环境声音识别同样也在各领域取得了广泛的应用。如基于机器声音识别的故障诊断、基于道路交通声音识别的辅助驾驶等。目前实现声音识别的准备工作分别为特征参数的提取和构建识别模型。近年来,为提高声音识别准确率、识别速度,各种识别模型被提出,这项智能技术在不断地更新进步。
在声音识别领域,早期采用的是语音识别中孤立词识别的方法,其原理是对一段输入信号进行逐帧单独识别,针对识别信号的长度各有不同的情况。上世纪60年代,日本学者Itakura首次动态时间规整(Dynamic Time Warping,DTW)算法应用到语音识别领域[1]。在识别过程中,不能简单的将输入的声音与模板直接比较,即使是同一种声音,其信号在时间长度上也不会完全相同,直接比较会降低识别率,因此可对声音信号进行时间规整,将待测声音信号伸长或缩短,直到与参考模板的长度一致。DTW算法基于动态规划(Dyna-mic Programming,DP)的思想,能够将输入信号的时长与模板的时长进行动态匹配,它也是声音识别技术中出现较早的一种算法[2]。
实验结果证明,将DTW算法应用到语音识别领域在对孤立词识别方面确实有着较好的识别效果,但其最明显的缺点在于这种方法实现需要对大量路径及这些路径中的所有节点进行匹配计算,从而导致计算量极大,随着声音样本量及样本长度的增大,其识别时间甚至将达到难以接受的程度,因此,无法直接应用于大、中样本量声音识别。……