李 俭,郭川军,姜 微
(哈尔滨金融学院 计算机系,黑龙江 哈尔滨150030)
随着社会的数字化变革、因特网的蓬勃发展及国民经济的迅猛崛起,全球各个领域的数据呈爆炸式增长。数据作为信息的载体,已成为包括金融经济、交通物流、国家安全和社会生活等各个领域最核心、最有价值的资源。因此,为了发现数据背后隐藏的巨大价值,从商业应用领域到科学计算领域,面对海量数据的计算密集型应用需求日益增加,许多电子商务网站和社交网站需要存储海量异构的页面信息、用户信息以及访问日志等,并对这些数据进行快速而准确地访问以及面向商业市场前景的智能计算。这些典型的计算需求包括用户购买能力分析、定向广告投递效果查询、产品增值的市场分析等,这些已成为互联网中的核心问题。基于这些海量数据的查询分析,从中获取有利于互联网用户体验的信息,从而形成商业利益的有效价值链是十分有意义且充满挑战的工作。实现对计算密集型海量数据的有效查询,需要从各项技术角度加以协调。
大规模分布式可靠存储系统可为计算密集型查询任务提供重要的后台支撑,同时满足系统在读写效率、查询速度和吞吐量上的要求。在互联网中,计算机用户实现大规模的文件存储、共享和交换时,基本上都是基于P2P技术,比较著名的基于P2P的分布式存储系统有 Napster、Kazaa、Ocean Store等。其中,Napster将系统中所有计算机节点认为是同一级别,文件标识号和文件存储节点间存在一个约定好的映射关系,这使得用户在查找某个文件时,可以通过计算快速定位到文件存储节点,从而建立连接并下载文件。……