王沛然,马小宁,王 喆,邹 丹,刘 敏
(中国铁道科学研究院集团有限公司 铁路大数据研究与应用创新中心,北京 100081)
随着中国高速铁路的飞速发展和铁路信息化建设逐步完善,中国铁路积累了大量与铁路相关的结构化、半结构化、非结构化数据[1]。对这些数据进行全面有效管理和深入分析挖掘,充分发挥数据的价值,对提高铁路运输生产效率、降低运输成本、提升客货运产品服务质量、提高运营管理水平等具有重要意义[2]。
铁路数据服务平台是大数据应用的基础和技术支撑,为大数据应用提供数据基础、存储、计算和分析等能力。铁路数据服务平台提供结构化数据与非结构化数据的接入能力,同时支持PB级离线数据的分析;在实时数据分析端,支持TB级数据的实时分析[3]。
存储作为大数据平台的重要组成部分,只有在合理而高效的大数据存储架构支撑下,才能对铁路行业的大数据进行快速存取、检索并提高整个系统的吞吐量,大数据及数据挖掘应用才可以开拓其核心价值。目前,Hadoop已成为大数据处理的标准,Hadoop处理数据的生态日渐丰富,它能够满足大数据的多种需求[4]。仅运用Hadoop作为数据存储组件,将海量铁路数据存入“数据湖”中,无法对这些数据进行管理监控,很容易形成“数据沼泽”[5],所以集合多种存储方式的存储架构才能适应当前数据存储的发展要求。如何将数据安全稳定的存储,如何对数据在存储过程中进行全链路监控管理,如何跨存储组件无感共享,都是数据储存架构需要考虑的问题。……