马玉洁,倪旭昇,邹 孝,董 胡,2,赵新民,钱盛友
(1. 湖南师范大学 物理与电子科学学院,湖南 长沙 410081;2. 长沙师范学院 信息科学与工程学院,湖南 长沙 410100)
语音增强技术通常被用来处理语音的噪声污染问题. 相比传统的语音增强方法,一些新兴的语音增强方法效果更好,如:结合听觉掩蔽效应、压缩感知、深度学习的语音增强方法[1]. 随着视听交互研究的逐渐兴起,利用跨模态技术对信号进行处理的方法也开始受到关注,研究人员将原本分开处理一维声音信号和二维图像信号的技术转向创造性的跨模态处理[2]. 我们可以利用图像处理技术来处理语谱图,这种技术已应用于音乐转录、乐器声音分离、降噪等[3-5]. 相反,我们可以从视为语谱图的图像中产生声音信号,这种技术称为图像到声音的映射或模式回放[6-9].
Han等[10]将监督学习的方法扩展到去噪中,在没有受限玻尔兹曼机(Restricted Boltzmann Machine,RBM)预训练的情况下对深度神经网络(Deep Neural Networks,DNN)进行训练,DNN被训练直接学习从损坏语音的语谱图到干净语音的语谱图的频谱映射. 这种使用DNN进行语音增强的方法通常比较复杂,需要大量的实验组,实时性不强. 王杰等[11]提出利用图像处理技术中的双边滤波算法对非平稳语音信号进行去噪,该方法可以从视觉上分析声音的时频特性. 但双边滤波通常效率偏低且在细节处理上有可能会产生梯度反转. 引导图像滤波(Guided Image Filtering,GIF)是在双边滤波的基础上提出的一种图像滤波处理方法,同样具有……