张华丽,杨 帆,杨华勇
(武汉科技大学城市学院,湖北 武汉 430083)
随着云计算下大数据的广泛应用,大数据的容积逐渐增大[1],分布式存储在处理大数据时具有扩展性、可维护性、可靠性,在成本估算中都有突出的表现[2],在分布式的数据库系统中,通常情况中它的最大特征是存在数据冗余,云计算下分布式存储中冗余数据的分配问题,对于确保大数据安全性具有重要意义,其成为当下相关技术人员研究的热点问题。
以往针对大数据冗余数据集分配问题,主要以支持向量机算法为主,该种算法分配大数据中冗余数据时,仅能进行小样本数据中冗余数据的分配,且不能解决大数据中的冗余数据间关联性低的问题,具有分配效率和准确率较低等弊端。如文献[3]提出了一种动态非冗余数据分配方法,该方法确定了碎片更新参数和动态成本参数,根据数据迁移节点的最低代价的选择,使用参数迭代估计片段的重新分配到节点的成本,然而,该方法冗余数据间的关联性较低。文献[4]提出基于图覆盖的大数据全比较数据分配算法,采用理论分析把大数据全比较的数据分配问题总结成图覆盖问题后,获取图覆盖的最优解,依据特解分配数据,由于过程较为复杂,导致数据分配的效率低;文献[5]提出针对多聚类中心大数据集的加速K-means聚类算法,主要采用动态类中心调整方法对大数据进行聚类,但是由于在K-means算法中,首先需要根据初始聚类中心来确定一个初始划分,然后对初始划分进行优化。……