一种基于改进的TF-IDF和支持向量机的中文文本分类研究

2016-02-13 05:58:20郭太勇
软件 2016年12期
关键词:分类文本

郭太勇

(北京邮电大学网络空间安全学院,北京 100876)

一种基于改进的TF-IDF和支持向量机的中文文本分类研究

郭太勇

(北京邮电大学网络空间安全学院,北京 100876)

TF-IDF是一种应用在文本分类中常用的权值计算方法,传统的TD-IDF单纯考虑特征词频率以及包含特征词的文本数量,并没有很好的考虑特征词在文本中的重要程度以及类内分布均匀情况和类间分布离散的问题,可能会导致文本分类结果的偏差。本文引入卡方统计量CHI和特征词在文本中的位置作为修正因子并结合传统TF-IDF权值计算公式,很好的解决了特征词在类间分布以及关键词重要程度不足的问题,并应用支持向量机构建分类器,进行文本分类的实验验证。改进后的TF-IDF计算公式与传统TF-IDF相比,在查准率、查全率、F1测试值上都有一定程度的提升。

文本分类;TF-IDF;卡方统计量;支持向量机

0 引言

文本分类技术是信息检测和数据挖掘技术的基础,能够帮助用户从海量数据中获得自己需要的有用内容。它能够按照预先定义的文本主题类别,为文本集合中的每个文本确定一个类别,对文本进行准确、高效的分类,是许多数据管理任务的重要组成部分。目前文本分类技术已经广泛应用在搜索引擎、机器学习、信息过滤、数字图书馆、分类新闻组等领域。常见的文本分类算法有传统的增强学习算法、K-近邻算法[1]、朴素贝叶斯算法[2]、决策树学习算法、支持向量机[3]和神经网络算法等。

TF-IDF权重方法是文本分类领域中应用最为广泛的一种特征权值方法,由Salton在1988年提出,在此基础上,国内外学者进行了大量的改进工作,主要的改进集中在数据集偏斜、文本类内类间分布情况。……

登录APP查看全文

猜你喜欢
分类文本
分类算一算
垃圾分类的困惑你有吗
大众健康(2021年6期)2021-06-08 19:30:06
初中群文阅读的文本选择及组织
甘肃教育(2020年8期)2020-06-11 06:10:02
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
人间(2015年20期)2016-01-04 12:47:10
给塑料分分类吧
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13