张禹尧,蒋玉茹,张仰森
(北京信息科技大学 智能信息处理研究所,北京 100101)
角色识别(character identification)任务的目标是在多人参与的对话中,将每个人物提及(mention)映射到具体的人物实体,这里的人物提及可以是任何表示人物的名词,如“他”“阿姨”等。由于多方对话数据中的上下文往往由多个角色轮流交替发言组成,其中包含着大量的对话场景内以及对话场景外的人物提及,因此想要正确理解上下文的内容,必须明确这些人物提及的具体指代。换言之,角色识别任务是多方对话理解中关键性的步骤,也是后续高级自然语言处理任务(机器问答、文本摘要、信息抽取等)能应用在多方对话数据上的基础[1]。
Chen等[2]对美剧《老友记》(Friends)的剧本进行了收集、整理、标注,构建了第一个关于多方对话理解的数据集,并将其以任务的形式发布在了SemEval2018 Task4[3]。在该评测任务中,来自庞培法布拉大学的Aina等[4]为了提升非高频角色的识别效果,构建了基于角色实体库的角色识别模型(AMORE-UPF),取得了评测的冠军。然而,就最终的评测指标来看,该模型取得的效果似乎仍不尽如人意。原因一定程度上来自于模型的编码器部分,该部分仅由单层的BiLSTM构成。一方面,数据中存在着大量的长对话,尽管LSTM相较于基础的RNN结构能保留更长的记忆信息,但是对于过长的文本,同样会有信息的丢失;另一方面,对话之间是存在着信息关联的,只使用BiLSTM无法捕获这种信息之间的关联。本文针对这两方面的问题,提出了一种基于多尺度自注意力增强的多方对话角色识别方法(multi-scale self-attention character identification,MSA-CI)。……