陈鹏之,张 瑾,刘 悦,程学旗
(1.中国科学院计算技术研究所 中国科学院网络数据科学与技术重点实验室, 北京 100190;2.中国科学院大学, 北京 100049)
实体关系联合抽取是指从非结构化文本中抽取出具有某种语义关系的实体对,即实体关系三元组,如图1所示。它应用广泛,可以用于构建知识图谱和本体知识库,支持上层应用,如问答系统、搜索引擎等,为其他自然语言处理技术提供支持。

图1 实体关系三元组抽取
传统的实体关系抽取任务通常采用管道式(pipeline)模型,将实体关系抽取分成命名实体识别与实体关系分类2个独立的子任务,2个子任务独立工作。
管道式方法的优点是可以灵活调用每个模型,每个模型都可以应用到不同的场景,同时缺点也很明显,它忽视了实体识别与关系分类之间的语义关联;其次,实体识别引入的错误会影响关系分类的效果;最后,任意实体对间不一定都存在某种关系,但需要对所有实体对进行关系分类。
近几年研究者们逐渐将实体关系抽取当成一个整体任务来研究,同时抽取句子中的实体和关系。与管道式抽取方法相比,联合式抽取方法[1]能够有效利用实体和关系间紧密的交互信息,同时抽取实体并预测实体间的关系。Kate等[2]在2010年提出了“卡片-金字塔”的图形结构,并将其用在实体关系联合抽取上。Yang等[3]在2013年提出了一种联合抽取模型,使用整数线性规划提取符合条件的实体及关系。Katiyar等[4]在2016年首次将深度双向LSTM序列标注的方法用于联合提取观点实体IS-FROM、IS-ABOUT关系。……