杨先凤,赵家和,李自强
(1.西南石油大学 计算机科学学院,成都 610500; 2.四川师范大学 影视与传媒学院,成都 610066)(∗通信作者电子邮箱565695835@qq.com)
融合字注释的文本分类模型
杨先凤1*,赵家和1,李自强2
(1.西南石油大学 计算机科学学院,成都 610500; 2.四川师范大学 影视与传媒学院,成都 610066)(∗通信作者电子邮箱565695835@qq.com)
针对传统文本特征表示方法无法充分解决一词多义的问题,构建了一种融合字注释的文本分类模型。首先,借助现有中文字典,获取文本由字上下文选取的字典注释,并对其进行Transformer的双向编码器(BERT)编码来生成注释句向量;然后,将注释句向量与字嵌入向量融合作为输入层,并用来丰富输入文本的特征信息;最后,通过双向门控循环单元(BiGRU)学习文本的特征信息,并引入注意力机制突出关键特征向量。在公开数据集THUCNews和新浪微博情感分类数据集上进行的文本分类的实验结果表明,融合BERT字注释的文本分类模型相较未引入字注释的文本分类模型在性能上有显著提高,且在所有文本分类的实验模型中,所提出的BERT字注释_BiGRU_Attention模型有最高的精确率和召回率,能反映整体性能的F1-Score则分别高达98.16%和96.52%。
一词多义;字注释;基于Transformer的双向编码器;双向门控循环单元;注意力机制;文本分类
随着中国互联网行业的快速发展,根据第43次《中国互联网发展趋势报告》[1],截至2020年12月,中国互联网用户已达9.89亿,互联网普及率达70.4%。人们在网络上随时随地获取自己热爱领域的优质文本信息,已经超越传统纸质阅读成为了新的阅读热潮。……