胡昕
摘 要:对现有多款云计算平台做了分析与对比。之后选定 Hadoop 开源云平台作为项目的基础研究平台,对其进行深入的分析与讨论。
关键词:Hadoop;数据处理;挖掘
曾有一句话在互联网业界广为流传:“大量的数据胜于好的算法”,这句话的意思是说对于某些应用,相比与优秀的算法,大量可用的数据能够带来更好的推荐效果。这就是数据处理和挖掘。数据处理的根本目的是利用有效的手段快速准确的获取数据、加工数据、应用数据。这其中,数据挖掘技术是将收集到的数据得以有效应用的核心技术。数据挖掘(Data Mining)技术又被称作数据库中的知识发现,其核心就是从大量杂乱无章的、难以理解的数据中获取有效的、新颖的、具有潜在应用价值的信息的过程。
目前比较有研究价值的 Web 挖掘的方向有:(1)数据预处理技术方向。(2)现有挖掘算法改进方向。(3)智能搜索引擎方向。(4)电子商务领域应用方向。
海量数据处理虽然刚刚兴起,但数据在企业中一直处于核心地位,传统的数据产品,在企业中部署运行多年,为企业的经营决策贡献巨大。企业现有数据产品的服务商,排在前六位的分别是 Oracle(27.93%)、IBM(15.99%)、Microsoft(14.41%)、Apache Hadoop(9.01%)、EMC(8.33%),以及SAP(7.66%)。Oracle 以绝对优势拔得头筹,可见其在数据库、数据分析和大数据方面的地位。值得一提的是Hadoop 的普及水平已超出我们的想象,成为继 Oracle、IBM和 Microsoft 之后又一主流平台产品。
Hadoop 云平台由分布式文件系统 HDFS 与并行计算构架MapReduce两个核心组件构成。接下来将对 Hadoop 的核心组件、主要构造模块及拓扑结构进行分析与讨论。……