马建红 魏字默 陈亚萌
(河北工业大学人工智能与数据科学学院 天津 300401)
专业领域资源命名实体识别(Named Entity Recognition,NER)[1]和关系抽取(Relation Extraction,RE)[2]是对资源描述的文本进行信息抽取的重要方式,基于实体和关系可以构建出资源库和资源知识图谱,可以更好地促进自然语言处理(Natural Language Processing,NLP)上层任务的发展。
当前,完整解决NER和RE这类问题的场景需求很多,一般可以归结为对应的两个子任务,主要有两种完成方式,一种是流水线方式;另一种是联合学习方式。
目前的研究以流水线处理方式较多,例如:对于命名实体识别,张海楠等[3]、何炎祥等[4]分别使用神经网络和机器学习方法完成NER任务;对于关系抽取,Yan等[5]、 Li等[6]采用改进的深度学习方法完成RE任务。这种流水作业方式使得两个子任务易于处理,但存在一些缺陷,例如:忽略了两个子任务模块之间的关联性,前一个子任务的错误会顺延传递到下一个子任务;两个子任务都是对原始文本进行处理,做了重复性的数据处理工作,处理效率低。
与流水线处理方式不同,联合学习方式可以有效解决上述问题。基于深度学习的联合抽取方式拥有以下优势:① 采用深度学习的模型可以自动学习句子特征,无须人工构建复杂的特征工程;② 这一方式考虑了子任务之间关联性的同时,避免了流水线方法中子任务训练误差、错误率累计传播和冗余实体产生等问题;③ 端到端的学习方式较大地提升了处理效率[7]。因此,研究有效的联合抽取方式更具实际意义。……