陆 亮,孔 芳
(苏州大学 计算机科学与技术学院,江苏 苏州 215006)
实体关系抽取旨在从非结构化文本中获取实体间所具有的语义关系,抽取出来的信息以三元组
目前,受限于语料资源,实体关系抽取相关研究多集中于新闻报道、维基百科等规范文本。而这类文本通常由专业人士编辑,行文规范,文本内容的信息密度大。随着DialogRE[4]数据集的发布,针对对话文本的实体关系抽取研究得以展开。相较于规范文本,对话文本的特点明显,主要体现在: ①对话中存在大量指代和省略现象,特别是人称代词出现频率较高; ②相比规范文本,对话文本中信息密度较低,存在关系的实体对通常出现在不同对话语句中; ③对话内容通常围绕某些特定主题在交互过程中向前推进,因此对话的交互过程蕴含了大量重要信息。因此,在规模有限的对话文本中如何尽可能多地提取有效特征,特别是隐藏在交互过程中的信息,构建面向对话文本的实体关系抽取模型则更具挑战性。
本文采用轻量级的Star-Transformer[5]模型作为主模型,基于这一模型进行了两个核心工作: ①关注对话交互信息: 目前已有的研究在处理对话语料时大多选择直接将对话拼接成一段长文,这样做的后果是模型难以获取到对话交互过程的信息。……