马金林,朱艳彬,马自萍,巩元文,陈德光,刘宇灏
1.北方民族大学 计算机科学与工程学院,银川750021
2.图像图形智能信息处理国家民委重点实验室,银川750021
3.北方民族大学 数学与信息科学学院,银川750021
随着人工智能技术的发展和计算机算力的增强,唇语识别逐渐成为研究热点。唇语识别是一种通过视觉特征解释唇部、面部和舌头的运动来理解语音的技术,最初由Sumby等[1]在1954年提出,1984年,Illinois大学[2]建立了第一个唇语识别系统。与其他识别系统(包括人脸识别、指纹识别和手势识别)相比,唇语识别具有时效性、方便性和直接性的特点。唇语识别涉及模式识别[3-4]、计算机视觉[5]和图像处理等研究领域。由于其在信息安全[6-7]、语音识别[8-9]和辅助驾驶[10]方面具有应用价值而受到广泛关注。
根据识别模式的不同[11],将唇语识别分为视听语音识别(Audio-visual Speech Recognition,AVSR)和视觉语音识别(Visual Speech Recognition,VSR),AVSR是指利用唇部视觉信息辅助音频语音识别,VSR仅使用唇部的视觉信息。2016年之前,传统技术研究较为广泛,详见文献[12]。传统方法能够解决一定数据规模下识别精度不高的问题,但需要具备丰富唇读知识的研究者设计特征提取方法,此外,还存在泛化性不高的缺点。随着大规模数据集[13]的出现和识别任务复杂性的提高,基于深度学习挖掘人类视觉与认知规律的唇语识别技术成为发展必然。基于深度学习的唇语识别方法将一连串被裁剪的唇部图像送入前端以提取视觉特征,然后将其传递给后端以建立时间依赖的分类模型,并以端到端的形式进行训练。……