K-means++算法优化及其在地震前兆分析中的应用研究

2021-10-05 12:54:00苏倸玉
智能计算机与应用 2021年5期

苏倸玉,李 忠,朱 婷,张 伟

(防灾科技学院 应急管理学院,河北 燕郊065201)

0 引 言

K-means++算法是2007年由David Arthur和Sergei Vassilvitskii提出的,是K-means算法的改进版本。传统K-means算法的聚类效果以及运行时间在很大程度上受到初始聚类中心选择的影响,Kmeans++算法对此进行了改进。虽然K-means++算法在初始化簇中心时,增加了计算量,但在整个聚类过程中,能够显著地提升计算效率和改善聚类结果误差[1],被广泛应用于分类[2]、聚类[3-4]等领域。

但是,由于K-means++依旧存在难以确定合适的K值问题,可能导致聚类结果会产生局部最优解。基于此,本文针对K值难于确定的问题,采用3种方法联合确定最佳的聚类中心个数,从而改进Kmeans++算法,并将优化算法应用于地震地磁数据聚类分析中。

1 K-means++聚类算法

经典的K-means算法是无监督的聚类方法[5],具有简单、高效、易于实现等特点。局部搜索能力较强,且对于大数据样本空间的聚类有较高的效率[6],在数据聚类分析领域应用广泛[7]。但是,Kmeans也存在2个致命缺点:一是K值多以使用者的经验来确定,因此存在很大的主观性,在不同应用场景使用时造成很大困扰;二是初始值采用随机选取方式,可能造成算法收敛速度较慢、计算效率较低的问题。

基于上述问题,有学者提出了K-means++算法。在初始值选取时,采用样本点与中心点的距离作为概率值,距离越远则被选中的概率越大,距离越近则概率越小,从而有效解决了上述第二个问题。

K-means++聚类算法实现步骤如下:

(1)从样本集X中随机选择一个初始聚类中心点,加入到聚类中心集C中;……

登录APP查看全文