申 存,黄廷磊,梁 霄
(1.中国科学院大学电子电气与通信工程学院,北京 100049; 2.中国科学院电子学研究所,北京 100190; 3.中国科学院空间信息处理与应用系统技术重点实验室,北京 100190)
开放域知识图谱问答是一项具有挑战性的任务,其旨在结合知识图谱为自然语言问题提供相应的答案。近年来,大规模的高质量知识图谱发展迅速,并在许多领域得到了广泛的应用,典型的包括如Freebase[1]、DBpedia[2]等英文知识图谱以及Zhishi.me[3]、XLore[4]等中文知识图谱。由于知识的结构化形式,知识图谱已经成为开放领域问答的重要资源,越来越多的研究工作也集中在知识图谱问答上[5-6]。对于知识图谱问答,其主要挑战是对问句的语义理解,因为给定的问句是自然语言的形式,而知识图谱是结构化的信息存储,两者的表述存在差异,需要对问句和知识图谱的文本进行深入的语义关联,以从知识图谱中选取出与问句表述最为匹配的三元组作为候选答案。例如给定问句“你知道哈姆雷特是哪个国家的电影吗?”,首先需要从知识图谱中确定问句所包含的主题实体“哈姆雷特(1964年美国电影)”,然后从实体的属性中选出与表述“是哪个国家的电影”最为相关的属性“制片地区”以得到三元组“哈姆雷特(1964年美国电影)|||制片地区|||美国”。该过程主要包含2部分工作:实体抽取以及属性选择。
实体抽取主要是从问句中识别出实体提及并链接至知识图谱的过程。目前传统的研究主要通过搜索知识图谱中每个问句的n元语法(n-gram)来实现实体抽取[8-9],这种方法通常需要较大的搜索空间。……