贡桑德庆 安渊

引言
数据血缘是指在数据的全生命周期中,因数据的加工、融合、流转等产生的数据与数据之间的多种关系。通俗地讲,数据A经过处理产生了数据B,我们则称数据A和数据B具有血缘关系。不管是结构化数据还是非结构化数据,都存在数据血缘关系。数据血缘还具有归属性、多源性、可溯性和层次性等特性。
数据血缘应用
目前,数据血缘分析技术在数据治理和数据仓库领域的应用已经比较广泛,基于数据血缘的四大特征,其主要应用有以下几个方面:
数据溯源
依托于数据血缘关系可溯性的特点,根据血缘中的数据链路关系,可实现指定数据的来源和去向追溯,帮助用户理解数据含义,在全流程上定位数据问题,进行数据关联影响分析等,解决多层复杂逻辑处理后数据难以理解、难以应用和错误难以定位的问题。
数据价值评估
数据价值是数据管理的核心标准,不管是数据交易中的数据定价还是数据安全中的保护等级,数据价值都是一个重要的参考因素。因此,如何准确地评估数据价值成为企业面临的一大难题。传统的数据价值评估,往往完全依靠相关法规要求和业务经验,缺少在具体应用场景中的评估依据,数据价值评估脱离了数据的应用场景和真实的业务价值。而数据血缘则提供了一种基于数据实际应用的价值评估方法,使用者越多、使用量级越大、更新越频繁的数据具有更高价值。
数据质量评估……p>