祁青山,田生伟,禹 龙,艾山·吾买尔
(1. 新疆大学 软件学院,新疆 乌鲁木齐 830091;2. 新疆大学 信息科学与工程学院,新疆 乌鲁木齐 830046)
指代(anaphora)是在自然语言中常见的一种语言现象,在篇章中通常利用一个抽象的词语代替前面的某个具体的词语。语言学中将抽象的语言单位称为照应语(anaphor),而具体的实体称为先行语(antecedent)。确定某个照应语的先行语的过程称为指代消解[1]。指代消解对于自然语言处理(natural language processing,NLP)研究中的机器翻译(machine translation)、信息抽取(information extraction)、自动文摘(automatic abstracting)以及自动问答(question answering)等自然语言应用系统都具有非常重要的支撑作用[2]。指代消解分为指代(anaphora)和共指(coreference),回指也称为指示性指代,是当前的词语与上文中出现的具体的词语具有密切联系;共指也称为同指,是两个具体的词语对应于现实世界中共同参照物的指代[3]。
指代消解发展的几十年来,已经从基本的基于规则的研究方法逐渐过渡到机器学习的研究方法中。McCarthy[4]等首先提出将指代消解改成二分类问题,在候选先行语中判断与照应语是否具有紧密的联系,进而判断是否具有指代关系。Soon[5]等在此基础上提出使用机器学习进行指代消解的研究框架并给出了可用的系统。他们在语料中提取12种特征作为分类的标准,再利用支持向量机对其进行训练得到分类模型。这一思想影响了后期大多数学者的研究。Ng[6]等在Soon的基础上将特征扩充成53种;Yang[7]等提出了一种双候选模型,可以更好地确定照应语对应的先行语;Kong[8]等把中心理论应用到语义层,提高了指代消解的性能。……