景 源,孙浩源
(辽宁大学 信息学院,辽宁 沈阳110036)
现实的复杂声学环境,通常需要利用语音分离的方法来达到语音增强的目的.正因为语音分离对语音处理技术显得尤为重要,所以语音分离技术得到了广泛的研究,众多方法被相继提出以实现对语音信号的盲分离.例如,一些学者通过研究语音混合信号的时频特性来探索语音盲分离的可行性,同时还提出了一些利用语音时频特征的语音盲分离的方法.虽然,一些其他研究希望跳过时频特征,从其他角度来处理语音盲分离问题.但这些众多其他系统的性能无法与时频方法的性能相提并论,尤其无法将其缩放和泛化到大数据集方面.
目前的语音盲分离方法大多都是基于混合语音信号的时频域表示特征的基础上实现的,使用短时傅立叶变换(STFT)从混合频谱中近似估计出各个声源各自的纯净频谱[1],然后再通过使用非线性回归技术直接将混合频谱中的每个语音源信号的频谱近似表示出来[2-4],最后还原成分离后的语音波形.基于此原理,一些算法被提出可以先估计每个声源信号的加权函数(掩码),然后用其来掩盖在混合频谱中每个时频点上以恢复出各个源信号[5-7].由已有的一些文献可以看出,时频掩蔽方法现今仍然是最常见的语音盲分离手段,并且通过深度学习的训练手段来有效提高掩码估计的准确性,从而极大地提高了时频掩蔽方法的分离性能.在直……