基于粒子群优化的全比较计算数据分发策略

2021-08-06 08:23:20李雷孝王永生
计算机工程与应用 2021年15期
关键词:实验模型

李雷孝,邓 丹,李 杰,王永生

1.内蒙古工业大学 数据科学与应用学院,呼和浩特 010080

2.内蒙古自治区基于大数据的软件服务工程技术研究中心,呼和浩特 010080

全比较计算[1]是一种典型的计算模式,用于解决两两数据文件相关联的一类计算。全比较计算作为一类特殊的计算模式在众多学科领域中频繁出现,如:生物信息学[2-5]、生物测定学[6-8]、传统机器学习领域[9]、自然语言处理领域[10]、交通大数据领域[11]。

国内外学者针对全比较计算一直在开展研究,全比较计算是研究的热点之一。在国外,有学者曾将全比较任务所需的全部数据在分布式集群中的各个计算节点均复制一份[12]。这种分发方式适用于小数据量的情况,在面对海量数据时将造成严重的网络拥堵与存储空间的浪费。有人曾使用Hadoop的分布式存储文件系统(Hadoop Distributed File System,HDFS)来存储执行全比较任务所需的数据[13]。HDFS采用分布式的副本存储方案,该组件默认采用副本数为3的存储方案。这种数据存储方式,虽然能够节约存储空间,但无法保证在执行比较任务时数据的完全本地化。Chaudhary等人在分析生物序列时搭建了一个异构计算平台。为了实现整个系统的负载均衡,他们根据节点的硬件配置来分配任务。在数据分配方面,他们将数据库进行分割,然后将其分发到各个节点上。尽管使用异构计算平台进行计算,但仍然无法避免从集群中的其他节点上请求数据[14]。对于通用的全比较数据分发方案,有学者提出了使用启发式的方案来进行全比较计算的数据分发与任务调度[1]。……

登录APP查看全文

猜你喜欢
实验模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
做个怪怪长实验
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
太空探索(2016年5期)2016-07-12 15:17:55
FLUKA几何模型到CAD几何模型转换方法初步研究
《实验流体力学》征稿简则
一个相似模型的应用