刘里 刘小明
(北京理工大学计算机学院,北京100081)
术语是某种语言中专门指称某一专业领域一般(具体或者抽象)理论概念的词汇单位[1].领域术语集体现了领域的核心知识.自动术语抽取是信息抽取领域的重要研究课题,其在特定领域的应用需求越来越大:医疗、生物、计算机科学等领域均需要术语集来构建领域知识库.
传统的术语自动抽取技术可以归纳为基于统计和基于语言学知识两种方式.广泛采用的统计类术语抽取技术有基于语言模型统计领域相关性、领域一致性的方法[2]、基于互信息的方法[3]等.这些方法对候选结果按照统计指标进行排序,提取指标排序靠前的结果作为最终结果.基于语言学知识的术语抽取普遍采取利用术语的上下文环境,运用机器学习方法训练模型,进行自动抽取,这在特定领域取得了不错的效果[4].近期的术语抽取技术常常面临3个难点:(1)部分术语可以利用的上下文特征比较少,使得基于上下文的术语抽取算法无能为力;(2)传统算法是建立在待处理文本正确分词的基础上的;(3)对前期的领域知识(如领域词库)有较高依赖性,不便于跨领域移植.
传统的名词性术语抽取方法较多利用术语的领域特性,并对其赋予权重来识别[5].然而,这些方法常常碰到的困难是:对于非名词性术语,少量特征难以将其识别出来,过多的特征又会匹配多个特征而对术语识别产生冲突.针对这些问题,文中对领……