基于监督信号增强的唇语识别模型

2021-01-22 07:47:00苏渝校
科学技术创新 2021年3期
关键词:监督信号模型

苏渝校

( 广东工业大学,广东 广州510006)

1 概述

随着近几年来深度学习的快速发展,唇语识别任务越来越成为当前学术界的研究重点。由于唇语识别任务的困难性,当前学界对于唇语识别的研究普遍集中于单词级别的唇语识别,该任务是通过一个讲话者的一系列嘴唇图片,来识别出他/她所讲的对应词语。当前基于深度学习的唇语识别算法大部分以独热编码作为监督信号,通过最小化模型输出与监督信号之间的交叉熵来完成训练。这导致唇语识别算法在推理时会遇到如下挑战:

(1)嘴唇运动的多样性以及讲话者不同的发音习惯和语速,都会给识别带来困难,尤其是对于两个发音相近的词语,如果不能在特征层面上使两者具备更好的辨别性,那么误判是很容易发生的。

(2)由于光照、人脸角度等变化,导致识别时的准确率受到影响,这要求唇语识别算法需要具有较好的泛化能力。

2 相关工作

基于深度学习的唇语识别方法,根据其卷积部分对图像特征的提取方式可以分为全2D 卷积、全3D 卷积(即时空卷积)和2D、3D 卷积混合的方式。在全2D 卷积方面,Noda 等人[1]利用VGGNet 提取嘴唇特征,之后经由循环神经网络(RNN),在特定数据集上面实现了44.5%的短语识别准确率和56.0%单词分类准确率。在全3D 卷积方面,Chungg 和Zisserman[2]提出了基于VGG 结构的时空卷积神经网络,进行单词的唇语识别,在BBCTV 数据集上取得了比传统唇语识别方法更好的准确率。在3D 和2D 卷积混合的方式中,Stafylakis 等人[3]结合了时空卷积网络和ResNet34,并使用了Bi-GRU 建模上下文信息,在LRW 数据集上识别准确率是83%。……

登录APP查看全文

猜你喜欢
监督信号模型
一半模型
信号
鸭绿江(2021年35期)2021-04-19 12:24:18
完形填空二则
突出“四个注重” 预算监督显实效
人大建设(2020年4期)2020-09-21 03:39:12
重尾非线性自回归模型自加权M-估计的渐近分布
基于FPGA的多功能信号发生器的设计
电子制作(2018年11期)2018-08-04 03:25:42
监督见成效 旧貌换新颜
人大建设(2017年2期)2017-07-21 10:59:25
夯实监督之基
人大建设(2017年9期)2017-02-03 02:53:31
3D打印中的模型分割与打包
基于LabVIEW的力加载信号采集与PID控制