叶 雪,梁 娟
(陕西财经职业技术学院,陕西 咸阳 712099)
信息时代中出现了大量的数字信息,文本信息为最常用、最基本的方式,为了能够在海量文本信息中寻找自己所需要的,人们需要高效检索工具。如何能够对非结构数据进行存储与查询,属于重点研究内容[1]。上世纪90年代,人们对信息检索的要求越来越高,不再满足同个语种检索,要在检索结果中具备多语种信息。在国际互联网不断发展的过程中,Internet中信息资源数量与类型越来越丰富,语言也具备不平衡性与多样性。网络用户数量也越来越多,掌握语言也多样化。因为网络资源语种多样性与网络用户对语言掌握的差异化,导致人们通过网络对信息检索出现语言障碍,为非英语国家用户使用网络信息带来了不便[2]。因此,英汉跨语言信息检索设计的研究具有重要意义。
跨语言信息检索(CLIR)中的查询根据长度划分为长查询、短查询与标题查询,查询翻译已经成为针对跨语言信息检索最流行的技术,性能达到单纯检索效率的50%~75%;并且创建查询翻译处理模块和创建文档翻译处理模块对比,前者比较容易实现[3]。所以,将基于平行语料库的查询翻译作为跨越源语和目标语的语言界限方法,并且用英语双语词典作为主体的知识源实现查询翻译处理。在创建的面向英汉跨语言信息检索系统中,重点为汉语IR与查询翻译。实现系统的思想为:使初始源语(英语)查询翻译成为目标语(汉语)单词列表,之后通过翻译处理进行查询,利用汉语IR技术和概率方法得到相应文档列表。……