苏渝校
( 广东工业大学,广东 广州510006)
随着近几年来深度学习的快速发展,唇语识别任务越来越成为当前学术界的研究重点。由于唇语识别任务的困难性,当前学界对于唇语识别的研究普遍集中于单词级别的唇语识别,该任务是通过一个讲话者的一系列嘴唇图片,来识别出他/她所讲的对应词语。当前基于深度学习的唇语识别算法大部分以独热编码作为监督信号,通过最小化模型输出与监督信号之间的交叉熵来完成训练。这导致唇语识别算法在推理时会遇到如下挑战:
(1)嘴唇运动的多样性以及讲话者不同的发音习惯和语速,都会给识别带来困难,尤其是对于两个发音相近的词语,如果不能在特征层面上使两者具备更好的辨别性,那么误判是很容易发生的。
(2)由于光照、人脸角度等变化,导致识别时的准确率受到影响,这要求唇语识别算法需要具有较好的泛化能力。
基于深度学习的唇语识别方法,根据其卷积部分对图像特征的提取方式可以分为全2D 卷积、全3D 卷积(即时空卷积)和2D、3D 卷积混合的方式。在全2D 卷积方面,Noda 等人[1]利用VGGNet 提取嘴唇特征,之后经由循环神经网络(RNN),在特定数据集上面实现了44.5%的短语识别准确率和56.0%单词分类准确率。在全3D 卷积方面,Chungg 和Zisserman[2]提出了基于VGG 结构的时空卷积神经网络,进行单词的唇语识别,在BBCTV 数据集上取得了比传统唇语识别方法更好的准确率。在3D 和2D 卷积混合的方式中,Stafylakis 等人[3]结合了时空卷积网络和ResNet34,并使用了Bi-GRU 建模上下文信息,在LRW 数据集上识别准确率是83%。……