郭太勇
(北京邮电大学网络空间安全学院,北京 100876)
一种基于改进的TF-IDF和支持向量机的中文文本分类研究
郭太勇
(北京邮电大学网络空间安全学院,北京 100876)
TF-IDF是一种应用在文本分类中常用的权值计算方法,传统的TD-IDF单纯考虑特征词频率以及包含特征词的文本数量,并没有很好的考虑特征词在文本中的重要程度以及类内分布均匀情况和类间分布离散的问题,可能会导致文本分类结果的偏差。本文引入卡方统计量CHI和特征词在文本中的位置作为修正因子并结合传统TF-IDF权值计算公式,很好的解决了特征词在类间分布以及关键词重要程度不足的问题,并应用支持向量机构建分类器,进行文本分类的实验验证。改进后的TF-IDF计算公式与传统TF-IDF相比,在查准率、查全率、F1测试值上都有一定程度的提升。
文本分类;TF-IDF;卡方统计量;支持向量机
文本分类技术是信息检测和数据挖掘技术的基础,能够帮助用户从海量数据中获得自己需要的有用内容。它能够按照预先定义的文本主题类别,为文本集合中的每个文本确定一个类别,对文本进行准确、高效的分类,是许多数据管理任务的重要组成部分。目前文本分类技术已经广泛应用在搜索引擎、机器学习、信息过滤、数字图书馆、分类新闻组等领域。常见的文本分类算法有传统的增强学习算法、K-近邻算法[1]、朴素贝叶斯算法[2]、决策树学习算法、支持向量机[3]和神经网络算法等。
TF-IDF权重方法是文本分类领域中应用最为广泛的一种特征权值方法,由Salton在1988年提出,在此基础上,国内外学者进行了大量的改进工作,主要的改进集中在数据集偏斜、文本类内类间分布情况。……