郁启麟
(中国矿业大学 计算机科学与技术学院,徐州 221116)
K-means算法初始聚类中心选择的优化①
郁启麟
(中国矿业大学 计算机科学与技术学院,徐州 221116)
迄今为止,在数据挖掘领域,人们已经实现了多种聚类算法,其中使用最广泛的当属K-means聚类算法.然而,在数据挖掘中,K-means算法面临的一个主要问题就是初始中心点选择问题.本文提出了一种结合关系矩阵和度中心性(Degree Centrality)的分析方法,从而确定K-means算法初始的k个中心点.与传统方法相比,本文算法可得到更加优质的聚类结果.实验结果表明该算法的有效性和可行性.
数据挖掘;度中心性;K-means算法;聚类
随着互联网的不断发展,人们已经进入到了大数据时代,并且已经真正体会到无边际的海量数据.数据挖掘技术的实现,使人们可以利用这些海量数据,发掘出可供人们决策的知识.现有的数据挖掘方法有多种,主要包括关联规则分析、聚类分析、离群点分析、分类等.其中聚类是一种无监督学习的分类技术,聚类的目的是使同一类中的数据的相似度尽可能高,而且不同类的相异度也尽可能高.从而得到数据中潜在的分类信息.
主要的聚类算法有:基于划分方法、基于层次方法、基于密度方法、基于网格方法和基于模型方法. K-means算法是一种基于划分的聚类分析方法,该算法的运行效率较高,因此广泛应用于各个领域的聚类分析中,目前的许多算法都是围绕着它进行创新和拓展.但是,在传统的K-means聚类分析……