K-means聚类算法中聚类个数的方法研究

2017-09-03 10:13:56唐雅娟
电子设计工程 2017年15期
关键词:数据挖掘实验方法

刘 飞,唐雅娟,刘 瑶

(汕头大学 电子工程系,广东 汕头515063)

K-means聚类算法中聚类个数的方法研究

刘 飞,唐雅娟,刘 瑶

(汕头大学 电子工程系,广东 汕头515063)

在数据挖掘算法中,K均值聚类算法是一种比较常见的无监督学习方法,簇间数据对象越相异,簇内数据对象越相似,说明该聚类效果越好。然而,簇个数的选取通常是由有经验的用户预先进行设定的参数。本文提出了一种能够自动确定聚类个数,采用SSE和簇的个数进行度量,提出了一种聚类个数自适应的聚类方法(简称:SKKM)。通过UCI数据和仿真数据对象的实验,对SKKM算法进行了验证,实验结果表明改进的算法可以快速的找到数据对象中聚类个数,提高了算法的性能。

K-means算法;聚类个数;初始聚类中心;数据挖掘;K-means算法改进

近年来,随着科学技术的发展,特别是云计算、物联网等新兴应用的兴起,我们的社会正从信息时代步入数据时代。数据挖掘就是从大量的、不完整的、有噪声的数据中通过数据清洗、数据挖掘、知识表示等过程挖掘出数据隐藏的信息。目前,数据挖掘已经广泛的应用在电信、银行、气象等行业。其中,聚类算法是数据挖掘中比较常见的一种方法,并且广泛的应用在多个领域[1]。K均值算法通常是由有经验的用户对簇个数K进行预先设定,K值设定的不正确将会导致聚类效果不佳[2]。因此,本文提出了一种SKKM聚类算法,可以对K值大小进行确定。

文献[3]中提出了基于划分的聚类算法,该方法对簇的个数并不是自动的获取,而是通过有经验的用户进行设定。……

登录APP查看全文

猜你喜欢
数据挖掘实验方法
记一次有趣的实验
探讨人工智能与数据挖掘发展趋势
做个怪怪长实验
基于并行计算的大数据挖掘在电网中的应用
电力与能源(2017年6期)2017-05-14 06:19:37
NO与NO2相互转化实验的改进
实践十号上的19项实验
太空探索(2016年5期)2016-07-12 15:17:55
用对方法才能瘦
Coco薇(2016年2期)2016-03-22 02:42:52
一种基于Hadoop的大数据挖掘云服务及应用
四大方法 教你不再“坐以待病”!
Coco薇(2015年1期)2015-08-13 02:47:34
捕鱼