张海玲,邵玉斌,杨 丹,龙 华,杜庆治
(昆明理工大学 信息工程与自动化学院,昆明 650500)
随着信息时代的快速发展,自然语言处理(Natural Language Processing,NLP)的研究更加如火如荼.机器翻译是借机器的力量将一种自然语言翻译成另一种自然语言,是人工智能和自然语言处理领域的重要研究方向[1].机器翻译研究一直在不断的革新,从最初传统的基于规则的机器翻译,到基于统计的机器翻译,再到目前主流的神经网络机器翻译(Neural Machine Translation,NMT).神经网络机器翻译是基于词、短语和句子,使用一个非线性网络找到语言之间的关系,实现自然语言之间的转换[2],NMT因其翻译性能突出,已成为当下工业界和学术界的研究热点.目前在中文到英文的基于注意力机制的神经机器翻译模型取得了令人瞩目的成绩,但仍然存在一些不足,其中一个很重要的原因是中文句式结构的复杂性和语义的多变性造成了翻译效果不佳,如何利用语言学的知识增强翻译模型的性能是一个值得深入的研究方向.
句子的构成总是依赖于句法结构,比如句子可分为主谓宾定状补等成分,每种成分都会有对应的单词,在句法的约束下这些成分才能构成完整、通顺、流畅的句子.句法分析对语言是极其重要的.NMT在处理输入源语言和输出目标语言时,都采用序列化形式,往往忽略了语言中蕴含的句法结构知识[3].与其让模型单独依靠在训练过程中学会隐型句式结构,不如通过更为显性的方式将……