王玉荣,林 民,李艳玲
内蒙古师范大学 计算机科学技术学院,呼和浩特 010022
随着互联网多语言信息的发展,不同语言的知识共享与联系日益紧密,如何有效地表示不同语言文本所隐含的动态特征信息,已成为当下的研究热点。文本词向量能够表示文本语义、语法和结构等特征信息,跨语言词向量是单语文本词向量在多语言环境下的一种自然扩展。它认为具有相同概念的不同语言的词向量在向量空间中的距离非常接近,使得跨语言词向量可以在不同语言间进行词义推理和特征共享[1]。通过多语言的知识可以构建动态的共享特征空间,使得有利于发现跨语言相关知识的对齐效果,增强相关但不同的分类知识域间的联系。
近年来,跨语言词向量被应用于多个自然语言处理(natural language processing,NLP)任务中,如面向任务的对话系统[2-3]、词性标注[4-6]、命名实体识别[7-8]、信息检索[9]、依存分析[10]和个性化对话代理[11]。与其他跨语言模型相比,如基于多语言本体的跨语言模型[12],跨语言词向量模型有两大优势。第一,跨语言词向量模型能够对跨语言语义信息进行建模,准确计算跨语言词语相似度等信息,是跨语言词典构建[13]、跨语言信息管理[14]、跨语言信息检索[15]等多种跨语言应用的基础[16]。第二,跨语言词向量支持语言之间的模型转移,为迁移学习提供了桥梁。例如,跨语言迁移学习的一个重要研究方向是[17-20],通过提供公共的表示空间,实现资源丰富的语言和资源贫乏的语言之间的模型转移[1]。……