金 燕,黄 杰
(浙江工业大学 信息工程学院,浙江 杭州 310023)
文本分类是自然语言处理、数据挖掘、搜索等领域中不可缺少的技术。文本分类中以提取到的特征词与计算得到的特征词权重来表达文本,表达后的文本给分类器训练,训练好的分类器可以将未知类别的文本识别为分类器已知类别的文本。在文本分类中,文本的表达方法有向量空间模型(VSM)、布尔模型[1]与概率模型。Salton等[2]提出的向量空间模型(VSM)是常用的文本表达方法,以文本中各个特征词的权重为向量来表示文本。分类任务中常用KNN、朴素贝叶斯、SVM[3]、神经网络[4]等算法作分类器,神经网络不仅在图像识别[5]任务中有着较好的识别结果,而且在文本分类中仍然有不错的分类效果。
为了保证Web文本信息准确度高的特点,要求文本分类具有较高准确率的分类效果[6-7],而分类准确率很大程度受到特征提取效果的影响。在文本分类中特征提取的方法有互信息[8]、卡方检验[9]、信息增益[10]与TFIDF[11]等。其中,Jones[12]提出的TFIDF算法是最常用的文本特征提取算法,TFIDF涉及到两个概念:特征词在文本中的频率与特征词的逆文本频率。传统的TFIDF算法存在着严重的缺陷,学者们针对传统TFIDF算法的不足提出了改进。为了解决文本集偏斜带来的问题,How等[13]提出了描述类别词的方法,用特征词在类别中的总频数代替TFIDF的词频因子。针对传统算法中没有考虑到类别间的信息,徐冬冬等[14]引入描述类别因子,提出了包含类别信息的改进算法,提高了分类的平均准确度。……