汪志伟 朱福喜 刘世超
(武汉大学计算机学院 湖北 武汉 430072)
一种基于Wikipedia的词汇语义关联度计算方法
汪志伟朱福喜刘世超
(武汉大学计算机学院湖北 武汉 430072)
词汇语义关联度计算是信息检索和自然语言处理的关键问题之一。针对该问题提出一种改进的基于Wikipedia语义关联度计算方法WGR。该方法使用Wikipedia数据集作为背景知识库,在传统方法的基础上融合维基文章中的布局信息,并对维基概念的入链和出链使用不同的方法进行处理;引入Google搜索资源,经分类筛选后使用LDA建模计算关联度;最后综合两个数据集的结果得到WGR语义关联度。通过实验分析,WGR在与现有算法比较时,取得了更好的准确率。
语义关联度文章网络布局信息维基百科隐含狄利克雷分布谷歌
语义关联度研究是信息检索、人工智能等领域的基础性研究课题之一,有着重要的研究价值。
传统的语义关联度计算方法包括单纯的对大型语料库进行统计分析,不涉及到相关的背景知识[1,2],或者使用人工构建的带有少量外部知识的词典资源[3,4]。近年来出现了很多利用Wikipedia计算语义关联度的方法。维基文章间丰富的链接关系构成的文章网络及文本内容能提供大量明确定义的语义知识。虽然Wikipedia是数以百万计的用户协作编写的百科全书,内容覆盖广泛,有研究表明,其内容的准确性与由专家写成的大英百科全书相差无几[5]。与传统背景知识库相比,Wikipedia内容的结构化和准确性使其成为更好的语义关联度计算背景知识库。……