陈子阳,廖劲智,赵 翔,陈盈果
国防科技大学 信息系统工程重点实验室,长沙 410073
问答系统(question answering,QA)是自然语言处理(natural language processing,NLP)主要的研究领域之一,旨在让计算机能够理解自然语言形式的问题,并且自动地给出答案[1]。近年来,随着知识图谱(knowledge graph,KG)技术的不断发展,出现了以Freebase[2]、DBpedia[3]、CN-DBpedia[4]为代表的大规模知识图谱。知识图谱通过将现实中的知识结构化为实体与实体间关系,利用(h,r,t)的三元组形式进行表示,其中h、r、t分别代表头实体(head)、关系(relation)和尾实体(tail),这种组织形式更有利于研究者发现、探索知识之间的关联关系。因此,综合问答系统优势与知识库特性的知识库问答(knowledge base question answering,KBQA)受到了学术界和工业界的广泛关注[5-6]。
知识库问答旨在通过知识库中结构化的知识回答自然语言问题。目前主流的研究工作大致可分为两类:(1)基于语义解析(semantic parsing,SP)的方法,利用模板和标注信息对问题进行解析,将其转化为一个图查询语句,通过执行该查询语句来获取答案;(2)基于神经推理(neural reasoning,NR)的方法,通过从问题和答案中提取出对应的特征,设计相应的打分函数以评价候选答案和问题的语义相关性,最终得分最高的候选答案被作为模型预测的答案输出。
基于语义解析的代表性工作QUINT(自动化模板生成模型)[7]通过自动从问题语句的组成部分和KG 查询的对齐中学习语句-查询模板,解决了传统SP 工作中对人工模板的依赖问题。然而,由于知识图谱通常存在链接缺失问题,如DBpedia 和Freebase中分别有66%和71%的人物实体缺少出生地信息[8],导致了QUINT 无法通过简单的查询获得预期的结果。……