王 星,单力秋,侯 磊,于济凡,陈 吉,陶明阳
(1. 辽宁工程技术大学 电子与信息工程学院,辽宁 葫芦岛 125105;2. 清华大学 计算机科学与技术系,北京 100084;3. 清华大学 人工智能研究院知识智能研究中心,北京 100084;4. 清华大学 北京信息科学与技术国家研究中心,北京 100084)
随着信息技术的飞速发展,不同国家和地区之间的交流日趋频繁,这使得跨语言自然语言处理显得愈发的有价值。在跨语言自然语言处理中,双语词典是一项非常重要的资源,其可以提供词汇语义的跨语言等价信息[1],对许多跨语言自然语言处理任务很有帮助,例如,跨语言信息检索[2]、机器翻译[3]、跨语言标注投射[4]等。
随着社会的发展,新的概念、术语层出不穷,专业领域新词不断涌现,手工编纂双语词典的方法已经无法及时满足需求[5]。近年来,使用计算机技术自动提取双语词典的方法得到了许多研究人员的关注[6]。一般来说,使用计算机技术自动提取双语词典的方法按照语料库的不同分为基于平行语料库的方法和基于可比语料库的方法[7]。但是这两种方法往往会因为没有足够多对应的双语语料,以至于无法提取出新词或者某些技术术语[8-9]。Nagata等人[9]在2001年指出,对于某些技术术语,可以从部分双语数据中获得其双语信息。例如,在日语中,当引入众所周知的词(如技术术语或名称)时,通常在第一次使用后在括号中添加与之等价的英文。不仅仅是日语,在中文中也常会出现这种情形,例如,在“姚明”的百科信息中,就存在“姚明(Yao Ming),男,汉族”的信息,名词“姚明”的后面就是括号和姚明的英文。……