黄 蕊,赵晓群
(同济大学 电子与信息工程学院,上海 201804)
在保证语音质量的前提下降低编码速率一直是提高低速率语音编码性能的一个重要研究方向。在声学模型中,由于线谱频率(Line Spectral Frequency,LSF)有更为优良的抗干扰性和量化性,所以在低速率语音编码中,通常选取10维LSF参数来表征语音的声道特性,并采用高效率的矢量量化技术对其进行量化[1-2]。2.4 kbps的混合激励线性预测编码(Mixed Excitation Linear Prediction,MELP)一直是低速率语音编码的一个重要研究方向,它可以通过改善量化性能来优化编码性能,其中包括了改进矢量量化器和提高量化码书质量两方面。
语音编码技术经过几十年的发展,为了满足3G移动通信的需求,在1999年8月3GPP公布了基于码激励线性预测(Code Excited Linear Prediction,CELP)的自适应多速率窄带编码(Adaptive Multi Rate-Narrow Band,AMR-NB),其具有4.75~12.2 kbps的8种编码速率,能够更加智能地解决信源和信道编码的速率分配问题,应用至今[3]。为了更充分地利用声道参数的帧间相关性,AMR-NB利用一阶滑动平均(Moving Average,MA)预测模型来预测声道参数之后,对LSF残差矢量进行量化[4]。在非12.2 kbps的7种速率模式下,AMR-NB使用分裂矢量量化,将LSF残差矢量分裂为3、3、4维的3个子矢量进行量化。并且在量化第三个子矢量时5.15 kbps和4.75 kbps共用一套码书。这7种速率的声道参数量化比特分配见表1。
表1 非12.2 kbps的速率模式下声道参数量化比特分配
Tab.1 Non-12.2 kbps rate channel quantization bit allocation

编码速率kbps子矢量一bit子矢量二bit子矢量三bit4.758875.158875.908996.708997.408997.9599910.20899
有许多研究工作从改善矢量量化方法和降低码书尺寸两方面开展研究,达到降低编码速率的目的。一方面,可以在矢量量化时引入帧间相关性[5],例如多帧联合量化[6]和预测量化[7-8]。……