周泽华 陈 恒,2 李冠宇*
1(大连海事大学信息科学技术学院 辽宁 大连 116026)2(大连外国语大学软件学院 辽宁 大连 116044)
知识图谱(KGs)[1-2]已成为机器学习、数据挖掘和人工智能应用(包括问答)[3]中许多任务的关键资源,例如实体消歧[4]、命名实体链接[5]、事实检查[6]和链接预测[7]。典型的知识图谱通常是一个多关系有向图,由一组关系三元组(h, r, t)组成,表示两个实体h和t之间的关系为r,例如(Mark Twain,PlaceofBirth, Florida)。知识图谱具有丰富的结构信息,在许多应用中发挥着重要作用。
尽管如此,知识图谱仍远没有达到完备的程度。知识图谱补全(KGC)和关系抽取(RE)是扩展知识图谱的两种典型方法。知识图谱补全的目标是在知识图谱原有结构的基础上,用新的事实丰富知识图谱。关系抽取旨在从纯文本中提取关系事实。有许多工作致力于关系抽取,如基于内核的模型[8]、基于嵌入的模型[9]和神经网络模型[10]。
KGC任务可以分为两个非互斥的子任务:实体预测和关系预测。实体预测任务采用部分三元组(h, r, ?)或(?, r, t)作为输入并输出候选实体的排名列表。关系预测任务的目的是找到连接头实体和尾实体的关系排名列表。Context_RL在知识图谱补全任务中特别关注实体预测任务。
近年来许多KGC算法被提出,它们都有共同特点:使用低维嵌入向量表示实体和关系。如Unstructured[11]、 TransE[12]、TransH[13]和TransR[14]等嵌入模型,都是使用成对(margin-based)排名损失函数,衡量每个三元组中h+r和t之间ln范数表示的距离。
其他模型,如神经张量网络(NTN)[15]和合成向量空间模型(CVSM)[16],将多层神经网络解决方案纳入现有模型。……