王 俊,王修来,栾伟先,叶 帆
(1.南京信息工程大学 管理工程学院,江苏 南京 210044;2.南京传媒学院 传媒技术学院,江苏 南京 211172;3.中国人民解放军31102部队,江苏 南京 210002)
命名实体识别(named entity recognition,NER)是自然语言处理技术(natural language processing,NLP)中的一个重要领域,也是信息抽取、句法分析、文本分类、机器翻译和情感分析的关键[1],在自然语言处理中占有重要和基础的地位。命名实体识别的核心内容是找出一套高效可用的模型或算法以实现对文本中人名、地名、时间等实体要素的准确识别与抽取[2]。对于英文来说,由于英语中的命名实体具有比较明显的形式标志(即实体中的每个词的第一个字母要大写),所以实体边界识别相对容易,此时任务的重点只需要确定实体的类别。然而和英语相比,中文命名实体识别任务更加复杂,而且相对于实体类别标注子任务,实体边界的识别与分类更加困难。
命名实体识别的方法主要有基于词典的方法、基于规则和统计的方法以及基于深度学习的方法。基于词典的方法主要依赖于大量人工设定的字典数据,识别效果在特定的语料上具有较好的表现,但是其与识别的领域或文本紧密相关,当字典无法与识别主体匹配时,其识别效率低下,并且制定好的字典往往无法进行跨领域迁移[3]。基于规则和统计的方法从原理上来说就是一种序列化特征标注方法,对每个词使用若干类候选标签进行定义,并记录每个词的位置信息,采用HMM、条件随机场(conditional random field,CRF)或者SVM等分类模型算法进行词的分类与标注,从而确定实体类型[4]。……