翟社平,王书桓,尚定蓉,董苏苏
(1. 西安邮电大学 计算机学院,陕西 西安 710121;2. 陕西省网络数据分析与智能处理重点实验室,陕西 西安 710121)
知识图谱是一种结构化语义知识库,存储了现实世界中复杂的结构化信息,已成功应用于智能问答[1]、个性化推荐[2]等领域。知识图谱通常是以网络和图的结构来表示三元组中的元素,网络和图中的节点表示实体,节点之间的边表示不同实体之间的关系,通常使用三元组(头实体,关系,尾实体)来表示,也用符号(h,r,t)表示。近年来,大规模知识图谱的构建已经取得了很大进步,例如WordNet[3],Freebase[4]。但是,它们仍存在着严重的数据不完整和数据稀疏等问题。
为了解决上述问题,基于深度学习的知识表示方法引起学者的关注,TransE[5]便是其中最典型的模型,它将三元组中的元素(实体或关系)编码到低维空间中,实体与关系的嵌入通过最小化得分函数得到。然而,TransE及其扩展模型仅利用三元组的结构信息,很难准确表示好长尾实体的语义信息。因此有学者提出利用实体的多源信息来改善知识表示,例如实体描述、实体属性等。
在知识图谱中,大多数实体存在着简洁的文本描述,其中包含与这些实体相关的丰富语义信息。例如,在图1中展示了Freebase中的一个三元组及相关实体描述信息。可以看出,文本描述中存在着实体的一些附加信息,将这些信息融入知识表示中可以补充缺失的语义信息,有效缓解数据稀疏等问题。因此,一些工作[6-9]开始引入文本信息来改善知识表示,但是这些方法仍存在不足: ①尚未提出三元组结构信息与文本信息联合表示的有效方法。……