多阶段生成器与时频鉴别器的GAN语音增强算法①

2022-08-04 09:58:46尹文兵
计算机系统应用 2022年7期
关键词:信号模型

陈 宇,尹文兵,高 戈,王 霄,曾 邦,陈 怡

1(公安部第一研究所,北京 100048)

2(武汉大学 国家多媒体软件工程技术研究中心,武汉 430072)

3(华中师范大学 计算机学院,武汉 430077)

1 引言

在现实环境中录制的语音信号常常会受到背景噪声的干扰. 语音增强可以通过去除带噪语音中的噪声获得干净的语音信号,从而提高语音质量与可懂度. 它在听觉辅助设备、语音通信、语音识别前端等应用中发挥着重要作用.

传统语音增强算法以谱减法[1]、二值掩码[2]、维纳滤波法[3]以及最小均方差法[4]为主. 这些方法假设语音信号是平稳的,只能在高信噪比环境下对稳态的加性噪声发挥作用. 然而现实中大部分带噪语音的信噪比较低,并且带有混响与非平稳的噪声,传统语音增强方法无法处理该类低信噪比的带噪语音.

过去几年里,深度神经网络(deep neural networks,DNNs)逐渐应用到语音增强任务中来[5]. 凭借对复杂映射的强大建模能力,DNNs 可以从数据中学习到语音或噪声的深层特征,例如使用卷积神经网络(convolutional neural network,CNN)[6]或循环神经网络(recurrent neural network,RNN)[7]学习带噪语音到干净语音的频谱映射过程,从而达到去噪的目的. 为了引入语音的上下文信息,长短时记忆网络(long short-term memory,LSTM)[8]也被应用到语音增强中. 这些方法通常使用短时傅里叶变换(short-time Fourier transform,STFT)所得的频域幅度谱作为网络映射目标,同时使用带噪相位进行语音重构,这会导致幅度谱与相位谱不匹配的情况出现. 为了解决该问题,时域语音增强方法[9–11]逐渐受到人们重视. 该类方法通过直接增强……

登录APP查看全文

猜你喜欢
信号模型
一半模型
信号
鸭绿江(2021年35期)2021-04-19 12:24:18
完形填空二则
重尾非线性自回归模型自加权M-估计的渐近分布
孩子停止长个的信号
3D打印中的模型分割与打包
基于LabVIEW的力加载信号采集与PID控制
一种基于极大似然估计的信号盲抽取算法
FLUKA几何模型到CAD几何模型转换方法初步研究
高处信号强
环球时报(2010-02-11)2010-02-11 13:34:15