汪卫明,梁东莺
(深圳信息职业技术学院教学督导室,广东 深圳 518172)
基于语义依存关系匹配的汉语句子相似度计算
汪卫明,梁东莺
(深圳信息职业技术学院教学督导室,广东 深圳 518172)
在中文信息处理中,句子相似度计算是一项基础而核心的研究课题,长期以来一直是人们研究的一个热点和难点。句子相似度计算在实际中有着广泛的应用,它的研究状况直接决定着其他一些相关领域的研究进展,如信息检索的相似句子匹配、自动问答的问题匹配与答案抽取等,句子相似度计算都是非常重要的环节。本文提出了一种基于依存关系匹配的句子相似度计算方法,利用词语内在概念和词语相互依存关系计算句子之间的相似度。结果表明,该算法能显著提高返回结果的准确率。
依存关系;关系匹配;词义相似度;依存关系相似度;自然语言处理
目前,关于句子相似度的计算方法种类很多,从总体上看主要有以下几类:基于词语共现统计的方法、基于语义词典的方法、基于语法结构关系的方法以及基于词语排序的计算方法。国内学者从不同方面(如向量空间模型、语义距离、语义依存、公共短语等)来计算句子的相似度,下面分别介绍相关研究人员采用的不同方法。
1.1 基于词语共现的方法
基于词语共现统计的方法是一种最基本的方法,将文档看成词语的集合,不需要对文本内容进行深层理解,只是通过词语共同的出现次数来计算句子相似度[1,2]。……