利用质量估计改进无监督神经机器翻译

2021-04-29 09:29:08张桂平黎天宇
中文信息学报 2021年3期
关键词:监督质量模型

徐 佳,叶 娜,张桂平,黎天宇

(沈阳航空航天大学 人机智能研究中心,辽宁 沈阳 110136)

0 引言

最近,神经机器翻译(neural machine translation,NMT)的方法在机器翻译领域中脱颖而出,取得了极大的进展[1-3]。神经机器翻译通常由两个子神经网络组成,编码器网络将源语言句子编码成上下文向量,再由解码器网络将编码器网络编码的上下文向量迭代解码成相同意思的目标语言句子。通常在有监督的环境下,需要使用大量的双语平行句子对训练模型。然而绝大多数语言对几乎没有平行数据。无监督神经机器翻译(unsupervised neural machine translation,UNMT)成功打破了这种限制,仅仅使用两种语言的单语语料进行训练便可以完成常规的机器翻译任务。无监督神经机器翻译是基于神经机器翻译的,并结合去噪自动编码器和反向翻译[4-5]训练双重模型初始化与跨语言嵌入[6],达到机器翻译的目标。但是在无监督神经机器翻译模型训练过程中,反向翻译会产生大量的伪平行数据,而这些伪平行数据的质量在反向翻译训练中就变得至关重要。因此,在训练反向翻译的过程中控制伪平行数据质量是提升无监督神经机器翻译质量的一个关键。

本文提出了一种利用质量估计(quality estimation,QE)技术的方法,在无监督神经机器翻译训练反向翻译时设置一个固定阈值筛选伪平行数据,有效地提升了无监督神经机器翻译的效果。本文研究基于生成对抗网络[7],由反向翻译和语言建模分别作为生成器和鉴别器。通过使用质量估计评估并筛选反向翻译训练过程中生成的评分(HTER)比较高的伪平行数据。……

登录APP查看全文

猜你喜欢
监督质量模型
一半模型
突出“四个注重” 预算监督显实效
人大建设(2020年4期)2020-09-21 03:39:12
重尾非线性自回归模型自加权M-估计的渐近分布
做梦导致睡眠质量差吗
监督见成效 旧貌换新颜
人大建设(2017年2期)2017-07-21 10:59:25
夯实监督之基
人大建设(2017年9期)2017-02-03 02:53:31
3D打印中的模型分割与打包
质量投诉超六成
汽车观察(2016年3期)2016-02-28 13:16:26
监督宜“补”不宜“比”
浙江人大(2014年4期)2014-03-20 16:20:16