(1、2、3.湖北文理学院计算机工程学院,湖北 襄阳441053)
双语语料库作为基础资源,在机器翻译、跨语言信息检索、词典编纂等领域起着重要作用[1,2]。双语语料库按照互译程度的差异可分为平行语料库和可比语料库。所谓可比语料就是主题相同或相关的语料,不要求互为翻译对。可比语料库根据对齐的程度分为语料库级别和篇章级别。一些新闻网站,例如新华社,同时用多种语言发布新闻,一段时间内这些网站发布的多语种新闻的集合可视为语料库级别可比语料库,这种语料库从整体上是可比的,但具体到单个篇章并未对齐。本文针对的是篇章对齐的语料库。可比语料相对平行语料具有来源广泛、领域覆盖全面、内容时效性强和易于获取的优势。因此,近年来关于可比语料库的研究日益增多。在语料库的构建方面,也从构建平行语料库逐步转向了可比语料库。在可比语料库构建方面,国内外的相关研究也不少,例如,文献[3]从瑞典新闻网站和美国新闻网站获取语料,首次利用跨语言信息检索方式构建可比语料库;文献[4]从新华网下载中英新闻语料,同样采用跨语言信息检索方式进行对齐;文献[5]利用维基百科构建可比语料库;文献[6]从社交网站推特(Twitter)挖掘可比语料。这些研究有一个共同的特点就是基本采用离线的、一次性的方式构建语料库,生成的语料库的规模有限。文章尝试在上述研究工作的基础上设计了一种可比语料库在线构建系统,持续稳定的生成可比语料,以构建更大规模的可比语料库。……