方 自 远
(河南农业职业学院 河南 郑州 451450)
Non-iterative training Adversarial training
在人们生活和社会生产的诸多领域中,出现了大量自媒体类型的应用[1],如时尚领域的小红书、体育领域的虎扑、视频领域的哔哩哔哩,以及咨询服务领域的知乎等[2]。在这些应用中,大量的普通用户和意见领袖通过个人账号按照规定的格式上传文本内容、图像内容和视频内容[3],在用户上传内容的过程中往往需要指定该内容所属的类别,从而便于应用的管理和维护[4]。但在用户指定类别的过程中常常出现错误,而这些错误直接影响后续自动推荐服务的性能。为了解决该问题,许多应用集成了自媒体上传内容的类别检查程序,纠正错误的类别标注[5]。
文本内容是许多自媒体应用的重要组成部分,提供了关键的信息,因此区分文本内容的类别是其中的重点研究方向。在传统的文本分类方法中,基于中心的文本分类方法是一种高效率的方法[6],也是目前满足在线分类条件的主要方法,此类方法利用一些统计方法建模训练语料库和训练样本集的分布,然后利用距离度量方法将文本分类。此类方法包括许多不同技术的结合,包括随机森林[7]、k-近邻[8]和k-means[9]等分类器,以及模糊集分布[10]、字典分布[11]和粗糙集[12]等相似性度量方法。此类传统方法在时间效率上具有巨大的优势,但是在分类准确率方面存在明显劣势,尤其在处理高维文本数据集时,其分类准确率和时间效率均出现明显的下降。
深度学习技术具有强大的非线性学习能力,在许多工程领域内取得了成功[13]。……