张会云,黄鹤鸣*,李 伟,康 杰
(1.青海师范大学计算机学院,青海 西宁 810008;2.藏文信息处理教育部重点实验室,青海 西宁 810008;3.青海省藏文信息处理与机器翻译重点实验室,青海 西宁 810008)
随着语音识别技术的迅速发展,以计算机、手机、平板等为载体的人工智能研究日新月异。各种人机交互不再局限于识别特定说话人语音中的单一音素或语句,如何识别语音中的情感已成为语音识别领域的新兴研究方向。语音不仅包含说话人所要表达的语义信息,也蕴含说话人的情感状态。对语音情感的有效识别能够提升语音可懂度,使各种智能设备最大限度理解用户意图,从而更好地为人类服务。
情感是一种综合了人类行为、思想和感觉的现象[1]。语音情感是指从语音信号中获取相应情感信息,情感信息主要表现在内外两个层面:内在情感信息指心率、脉搏、血压等无法通过外表观察到的信息;外在情感信息指面部表情、声音、语气、眉头、姿势等通过外表能观察到的信息。语音情感识别(Speech Emotion Recognition,SER)指利用计算机分析情感,提取出情感特征值,并利用这些参数进行相应的建模和识别,建立特征值与情感的映射关系,最终对情感分类。
人的情感是通过面部表情、身姿、声音及生理信号等多种模态表现出来的[2,3]。情感判断可基于这些模态中的一个或多个进行,但单模态信息不全、易受干扰,而多模态信息能够互相印证、互相补充,从而为情感判断提供更全面、准确的信息,以提高情感识别性能。……