基于分层信息过滤的生成式文本摘要模型*

2021-05-19 01:35:14符升旗李金龙
网络安全与数据管理 2021年5期
关键词:文本信息模型

符升旗,李金龙

(中国科学技术大学 计算机科学与技术学院,安徽 合肥230026)

0 引言

自动文本摘要模型旨在提取出原文中的关键信息并生成摘要。对自动文本摘要的研究可以分为两大类:抽取式文本摘要和生成式文本摘要。抽取式文本摘要直接从原文中抽取出一些句子组成摘要,而生成式文本摘要首先构建一个模型对原文中的信息进行理解,然后根据对原文的理解以模拟人类的方式输出摘要。本文主要关注生成式文本摘要模型。

目前,生成式文本摘要模型主要基于序列到序列(sequence-to-sequence,seq2seq)模型构建[1-2]。seq2seq模型包含一个编码器和一个解码器。编码器对输入的原文进行编码得到文本表示,解码器对编码器的输出进行解码生成摘要。在实际中,输入文本通常包含冗余信息,即噪声[3],而seq2seq 模型会将输入文本的所有信息进行编码,包括噪声,这会导致最终生成的摘要不能很好地体现原文中的关键信息[4]。最近的一些研究[4-5]表明,对输入文本中的噪声进行过滤能提高摘要模型的表现。

对输入文本中的噪声进行过滤通常包含两个步骤[4-5]:(1)根据编码器的输出(局部向量)计算得到全局向量,全局向量代表了输出文本的整体表示;(2)根据全局向量和局部向量计算门向量,然后将局部向量和门向量按元素对应位置相乘,来实现对输入文本中语义噪声的过滤。例如,ZHOU Q[5]等人使用长短时记忆网络(Long Short Time Memory,LSTM)作为模型的编码器,然后将编码器最后一个时间步的输出作为全局向量进行噪声过滤。……

登录APP查看全文

猜你喜欢
文本信息模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
订阅信息
中华手工(2017年2期)2017-06-06 23:00:31
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
中外会展(2014年4期)2014-11-27 07:46:46
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13
健康信息
祝您健康(1987年3期)1987-12-30 09:52:32