高 巍,马 辉,李大舟,于 沛
(沈阳化工大学 计算机科学与技术学院,辽宁 沈阳 110142)
人工生成摘要可以提取文本的有效信息,但是其面临人工资源不足与低效率的难题。自动文摘[1]是自然语言处理领域的重要分支,它是通过计算机对文本信息进行压缩和提取,生成简短的能有效概括文本内容的短文或句子。自动摘要问题可以看成一个输入序列到一个输出序列的映射过程,因此可以采用序列到序列模型来实现生成式文本摘要。随着深度学习技术的不断成熟,研究人员将深度学习与Seq2Seq模型相结合进行生成式摘要的研究。目前,该模型通常采用循环神经网络(recurrent neural network,RNN)来构造编码器和解码器。
随着深度学习的迅速发展为生成式文本摘要提供了另一种可行性框架,序列到序列模型,基本思想是根据输入序列的全局信息得到与之对应的输出序列,序列到序列模型由编码器和解码器两部分构成。Rush等[2]最先将该模型应用于生成式摘要,将卷积模型应用于对原文档进行编码,然后利用上下文之间的注意力前馈神经网络生成摘要,与之前的生成式方法相比,该模型是在“理解”源文信息的基础上生成摘要。See等[3]采用BiLSTM和LSTM分别构建编解码器,并采用指针机制来缓解未登录词问题,在确保生成摘要语义通顺和精确的基础上又具有新生单词的能力。谢鸣元等[4]考虑文本分类对生成式摘要的影响,利用卷积神经网络对文档进行分类,在Seq2Seq基础上结合文本类别特征生成摘要。……