基于PCA与KPCA的基因数据的特征简约

2013-09-21 07:23:50邢笑雪
长春大学学报 2013年12期
关键词:分类特征

邢笑雪,姜 利

(长春大学 电子信息工程学院,长春 130022)

基于PCA与KPCA的基因数据的特征简约

邢笑雪,姜 利

(长春大学 电子信息工程学院,长春 130022)

采用支持向量机方法(SVM)对上千维的基因表达数据分析时,算法的运行时间比较长。为了解决这种情况,本文采用了基于主成分分析的支持向量机(PCA-SVM)和基于核主成分分析的支持向量机 (KPCA-SVM)两种算法对数据进行降维和分类,既可以整合基因数据的特征信息又可以缩短计算时间。本文比较了累计贡献率不同时两种算法的分类准确率,实验结果表明,PCA-SVM分类准确率与累计贡献率二者之间没有明确规律,KPCA-SVM分类准确率随累计贡献率的降低存在降低或者保持不变的趋势。

特征简约;PCA-SVM;KPCA-SVM;累计贡献率

DNA微阵列技术的快速发展和后基因组时代的到来产生了海量复杂的基因表达数据集[1-2]。如何快速分析和处理海量数据,并从中挖掘到有价值的生物学信息已成为当下亟需解决的问题[3]。基因表达数据的样本数较少,但是特征量却有成千上万甚至更多,而且特征量之间存在相互关系,所以在对基因数据进行处理分析时必须进行数据的降维。数据降维即为所谓的特征简约,也叫特征选择。通过数据降维可以减小数据之间的冗余,提取有用的特征信息,降低数据处理的难度,得到更好的分类准确率。

1 特征简约

1.1 主成分分析

设原始样本的集合为{xi|xi=(xi1,xi2,…,xip)T,i=1,2,…,n},n 是样本个数,p 是样本特征个数。主成分分析[4]PCA(Principal Component Analysis)的原理是对原始的 p 个特征(x1j,x2j,…,xnj)T,j=1,2,…,p 去构造 p 个互相独立的新特征(y1j,y2j,…,ynj)T,j=1,2,…,p。……

登录APP查看全文

猜你喜欢
分类特征
分类算一算
垃圾分类的困惑你有吗
大众健康(2021年6期)2021-06-08 19:30:06
如何表达“特征”
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
教你一招:数的分类
给塑料分分类吧
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15