冯富人
(同济大学 铁道与城市轨道交通研究院,上海 201804)
轨道交通车辆在服役期间会产生巨量的数据,如列车轴速、受电弓电压、空气弹簧压力等。随着列车运行,这些数据会被动态地实时更新,形成了区别于传统数据库中静态数据的流数据。这些数据反映了列车的状态信息,对于保障列车安全运营和健康管理而言具有重要意义,而流数据实时性的特点也令其较历史数据具有更多有用的信息。传统的阈值判断方法过多地关注当前数据流的数值表现,却忽视了流数据变化趋势所隐藏的信息:如果阈值的裕量过大,则服役前期的识别效果差;若阈值的裕量过小,则随着性能的衰退,服役后期的误报率明显提高。
流数据处理方法重在能够实时有效地处理数据流,其要求算法的时间复杂度低,以满足流速要求,主要方法包括滑动窗体技术和关联技术等[1]。Chang Joong Hyuk[2]和李国徽[3]等针对滑动时间窗方法分别进行了研究,以满足其短时流数据中模式信息获取的需要。Seo Bok I, Kim Jae In等[4]提出了基于流环境的关联算法,能够快速地从提取的数据项中发现关联规则。具体到应用层面,基于内存的分布式流处理框架Spark Streaming是现今应用最为广泛的流数据处理平台,其能够较好地实现流数据信息的接收、快速处理和计算需要。基于Spark平台,吴海波、施式亮等[5]建立了瓦斯浓度流数据异常检测系统,提高了瓦斯风险评价时效。聂睿和黄鹏[6]将历史数据和实时数据进行联合分析,提高了实时采集数据的吞吐量以及准实时分析的计算速度,提高了飞机试飞效率。……