黄佳跃,熊德意
(苏州大学 计算机科学与技术学院, 江苏 苏州 215006)
机器翻译(Machine Translation, MT)是一门研究通过计算机实现人类翻译任务的学科,其在自然语言处理、人工智能领域中占有非常重要的地位。当下,机器翻译任务不仅在学术界得到了广泛的研究,工业界也有许多大型公司如谷歌、微软、百度在机器翻译的产品落地上投入巨资,并取得了鼓舞人心的效果,越来越多的人使用在线机器翻译系统跨越语言障碍进行交流。当前机器翻译领域的主流模型是神经机器翻译(Neural Machine Translation, NMT)模型,与传统的统计机器翻译(Statistical Machine Translation, SMT)模型不同,它基于编码器-解码器框架实现翻译任务,并在双语平行语料充足的多种语言对的翻译任务上性能显著超过了传统的统计机器翻译模型,甚至在“中-英”新闻领域翻译任务上取得了接近人类翻译的水准[1]。
然而,对于某些双语平行语料匮乏的低资源(low-resource)语言对的翻译任务,其翻译质量依旧不敌传统的统计机器翻译模型[2]。由此可见,拥有大量双语平行语料能使神经机器翻译模型在训练的过程中学习到更精确的翻译信息。句对齐任务作为一种获取双语平行语料的研究任务,也因此得到广泛的研究。
双语平行语料不仅在机器翻译模型的训练上扮演着重要角色,在双语词典编纂、术语研究应用、跨语言信息检索等方面也有很强的应用性。在术语应用方面,如果翻译人员发现待翻译的句子中含有不熟悉的术语,针对该术语的翻译可能就成为一个棘手的问题,此时双语平行语料可辅助翻译人员进行术语检索,供翻译人员参考相应术语进行翻译。……