朱志伟,刘湘云
(长沙民政学院 电子信息工程学院,长沙 410004)
随着社会经济建设的飞速发展,教育、交通、金融、旅游等领域对语音播报的需求不断增长。TTS(Text To Speech)文本转换语音技术是人机智能对话发展的趋势,利用此技术,通过MCU或者PC机控制语音芯片发音,能够实现多种场合下的文字即时阅读功能,如公交车报站、电子文本教材诵读、旅游导览语音服务、排队读序号等,这无疑在提高人机通信效率、提升系统服务质量、减轻人们工作强度等方面都有极大的好处。基于TTS技术的语音系统无需事先录音就能够随时根据查询条件查出并合成语音进行播报,从而大大减少了系统维护的工作量。
TTS语音合成的一般步骤如图1所示。存储在Flash ROM中的是编码后的语音参数,由MCU或PC机控制将Flash ROM中的数据取出并译码,根据相应的语音合成方法,由语音参数转换为数字语音信号,通过D/A转换器转换为模拟语音信号,经功率放大后,送入扬声器。

图1 TTS语音合成的一般步骤
TTS转换过程是先将文字序列转换成音韵序列,再由系统根据音韵序列生成语音波形。这个过程涉及语言学处理和韵律处理,目前实现这个过程较好的途径是,把基于规则的波形拼接技术和参数语音合成方法结合起来。
常用的语音合成方法主要有:共振峰合成、LPC(线性预测编码)参数合成、PSOLA(基音同步叠加)拼接合成和LMA滤波。在现阶段,共振峰合成和LPC参数合成需要的计算量较大,不适合在低端的嵌入式芯片上使用。……