张勇,高大林,巩敦卫,陶一凡
(中国矿业大学 信息与控制工程学院,江苏 徐州 221116)
关系抽取是信息抽取的一个重要组成部分,已被成功用于医学知识发现[1]、知识图谱构建[2]和问答推理[3]等诸多自然语言处理问题。关系抽取是指从非结构化的文本中抽取出实体对之间的三元组信息。
现有关系抽取模型或方法可大体分为2类:序列模型和依赖关系模型。序列模型主要针对单词序列进行建模[4-5],而依赖关系模型则是以句法依存关系树为基础,构建依赖关系模型[6-7]。已有研究表明,相对序列模型而言,依赖关系模型可以利用句法依存树提取出句子中隐藏的非局部语法关系[8-9],进而建立句内长距离的依赖关系。然而,在生成句法依存树时,它常依赖句法结构规则对句子结构进行修剪。这种基于规则的修剪策略可能会删除句子结构所包含的重要隐式信息。为此,Guo等[10]提出了一种基于软修剪的关系提取模型,用以实现模型自主学习句法结构,而无需对句法结构进行硬性修剪。虽然所提模型可以很好地学习句法结构,但是,由于图卷积模型本身的无向性,其对上下文中时序特征的学习能力较弱。
目前,已有学者以句法依存树为基础,提出了多种图神经网络模型,但是所提模型大多是基于图卷积神经网络[11]。图卷积神经网络可以很好地学习图结构数据的信息,却难以有效处理时序数据。这就意味着,面向具备时序特性的文本数据,只依赖图卷积神经网络并不能很好地抽取文本中时序信息。……