分块主成分分析在文本特征抽取中的应用

2015-04-21 10:37:12洪军建
河南科技大学学报(自然科学版) 2015年6期
关键词:分类特征文本

洪军建,珠 杰

(西藏大学 计算机科学系,西藏 拉萨 850000)



分块主成分分析在文本特征抽取中的应用

洪军建,珠 杰

(西藏大学 计算机科学系,西藏 拉萨 850000)

为了降低原始文本特征空间的维数,获得较高的分类精度与执行效率,对多种文本特征提取方法进行了研究,如卡方、互信息、信息增益、主成分分析(PCA)等。针对传统文本特征抽取方法存在的精度不高、执行效率低等问题,提出了一种基于分块主成分分析的文本特征提取算法。该算法通过K-均值词聚类进行特征词分块,再对各分块实施PCA操作抽取出更具代表性的特征项,最后使用支持向量机分类器对文本进行分类。实验结果表明:分块主成分分析的分类指标Fβ=1达到了88.7%,执行时间为353 s,能够有效提高文本分类精度与执行效率。

主成分分析;分块;特征抽取;词聚类

0 引言

随着网络的发展,互联网上涌现出大量的文本数据,处理海量数据的自动文本分类技术变得越来越重要,自动文本分类已成为处理和组织大量文档数据的关键技术[1]。对于采用向量空间模型(vector space model,VSM)的大多数分类器来说,文本预处理成为分类的瓶颈,高维的特征空间不仅增加了存储与计算的复杂度,而且其中很多特征是与分类无关的,甚至有一些是误导分类的噪声数据。为了达到降低特征空间维数、提高分类器的效率和精度的目的,需要从原始特征空间中挑选出一些具有代表性的特征。 研究发现:当特征维度高到一定程度时,分类器的精度随着特征维度增高而下降[2-3]。……

登录APP查看全文

猜你喜欢
分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15