潘亚宁,孟玉雪
(华北理工大学人工智能学院,唐山063210)
知识图谱存储的是实体和关系的结构化信息,通常由三元组的集合构成,每个三元组表示为(h,r,t)其中h、r、t分别表示头实体、关系和尾实体[1]。搜索引擎、问答系统以及推荐系统等都非常依赖现有的知识图谱(Knowledge Graph,KG),如Freebase、WordNet等,表示学习在这些应用中起到了至关重要的作用。最近的嵌入技术方面的工作已经大大提高了链接预测的准确性,但是大多数方法仅依赖知识图谱中的已知事实,它们的预测能力会受到数据库中不完整信息的限制,一种简单且有效的改进途径是从文本文档中合并其他信息来增强其嵌入[2]。
互联网上存在大量的文本数据,但是这些数据大多都是非结构化的,并且质量参差不齐。当前大多数表示学习方法只是简单地利用了知识图谱三元组数据,而忽略了这些文本。虽然最近的一些模型用到了文本信息,但仍未实现对这些信息的有效利用。也有一些方法试图将文本信息融合到知识图谱。如关系抽取旨在通过识别关联文本文档中提到的新三元组来扩展现有知识图谱。但大多数关系抽取方法都需要进行远程监督,其中数据库中每个现有的事实在文本中都用其提及来标记。基于启发式规则的技术通常以这种方式自动对齐现有知识图谱和文本[3]。但是这些方法的结果并不理想,因为句子中两个实体的同时出现并不一定意味着该句子说明了它们之间的关系。……