陈思阳
(山东科技大学计算机科学与工程学院,山东青岛 266590)
在大数据时代,数据开放与共享已成为必然趋势[1]。为了方便研究与应用,许多机构和组织会公开发布数据,然而这些数据可能包含个人敏感信息,如果直接发布会导致用户隐私泄露。例如,疾病预防控制中心需要从各种医疗机构收集病例,若未经处理便发布了原始信息,患者个人信息可能会被非法利用,对其日常生活造成严重影响[2]。为解决该问题,诸多学者对隐私保护数据发布(Privacy-Preserving Data Publishing,PPDP)方法[3]进行了研究,目的是保护原始数据的隐私信息,同时为后续数据分析保留尽可能多的数据效用。
k-匿名模型[4]是PPDP 领域提出的第一个隐私保护模型,由于其简单性和有效性而得到广泛应用[5]。k-匿名模型虽然可以防止身份泄露,但不足以防御属性泄露。因此,若干种扩展k-匿名模型被提出,如l-多样性[6]、t-紧密度[7]、(k,l)-多样性[8]、(α,ε)-匿名[9]、p-敏感度k-匿名[10],以及各种改进的匿名模型[11-13]。这些模型大多是基于k-匿名模型的传统隐私保护技术,需要特殊的背景攻击假设,不能提供严格有效的数学证明,从而降低了隐私保护的可靠性。
差分隐私保护方法由Dwork[14]提出,其克服了传统隐私保护方法的主要缺陷,无需考虑攻击者拥有的背景知识,并使用严格的数学推理证明对隐私保护模型进行量化。该方法要求在查询结果中添加噪声,因此主要应用于查询结果的发布中[15]。基于此,Hasan 等[16]提出一种非交互式保护框架,通过转换或压缩原始数据向查询结果中添加噪声以满足ε-差分隐私。……