徐 佳,叶 娜,张桂平,黎天宇
(沈阳航空航天大学 人机智能研究中心,辽宁 沈阳 110136)
最近,神经机器翻译(neural machine translation,NMT)的方法在机器翻译领域中脱颖而出,取得了极大的进展[1-3]。神经机器翻译通常由两个子神经网络组成,编码器网络将源语言句子编码成上下文向量,再由解码器网络将编码器网络编码的上下文向量迭代解码成相同意思的目标语言句子。通常在有监督的环境下,需要使用大量的双语平行句子对训练模型。然而绝大多数语言对几乎没有平行数据。无监督神经机器翻译(unsupervised neural machine translation,UNMT)成功打破了这种限制,仅仅使用两种语言的单语语料进行训练便可以完成常规的机器翻译任务。无监督神经机器翻译是基于神经机器翻译的,并结合去噪自动编码器和反向翻译[4-5]训练双重模型初始化与跨语言嵌入[6],达到机器翻译的目标。但是在无监督神经机器翻译模型训练过程中,反向翻译会产生大量的伪平行数据,而这些伪平行数据的质量在反向翻译训练中就变得至关重要。因此,在训练反向翻译的过程中控制伪平行数据质量是提升无监督神经机器翻译质量的一个关键。
本文提出了一种利用质量估计(quality estimation,QE)技术的方法,在无监督神经机器翻译训练反向翻译时设置一个固定阈值筛选伪平行数据,有效地提升了无监督神经机器翻译的效果。本文研究基于生成对抗网络[7],由反向翻译和语言建模分别作为生成器和鉴别器。通过使用质量估计评估并筛选反向翻译训练过程中生成的评分(HTER)比较高的伪平行数据。……