万家山,吴云志
(1.安徽信息工程学院 大数据与人工智能学院,芜湖 241000;2.安徽农业大学 信息与计算机学院,合肥 230036;3.安徽省北斗精准农业信息工程实验室,合肥 230036)
文本分类作为信息管理和应用的一种有效手段,主要是根据目标文档的主题或内容,将大量文本按照一定的分类体系或标准,依次归属到一个或多个类别的过程.在支撑主题抽取[1]、情感分析[2]、舆情分析[3]、垃圾邮件过滤[4]、智能问答[5]和推荐系统[6]等方面起着重要的作用.传统机器学习[7-8]的文本分类问题,通常采用提取词频或者词袋特征,然后通过分类器进行训练得到分类结果.深度学习与传统机器学习文本分类存在着相似之处,但两者在文本特征表示和分类预测等方面存在较大的区别.
文本分类主要涵盖文本特征表示(包含文本预处理、特征提取、文本表示三个部分)、分类器选择与训练、分类结果的评价与反馈等过程.分类器选择与训练作为文本分类的核心问题之一,在传统机器学习方法中,通常提取词频或者词袋特征,由模型进行训练.具有代表性的传统机器学习的分类方法,如朴素贝叶斯[9]、支持向量机[10]等.
目前,传统机器学习表现出的分类效果相对较低,这是因为传统机器学习是浅层次的特征提取,对于文本背后的语义、结构、序列和上下文理解不够,模型的表征能力有限.然而,深度学习分类模型表现出了相对较好的分类效果,这是得益于……