匿名数据集隐私保护效果度量机制

  • 臧帅 ,
  • 朱友文 , *
展开
  • 南京航空航天大学计算机科学与技术学院,南京 210016
朱友文()。

网络出版日期: 2024-11-16

基金资助

国家重点研发计划项目(2021YFB3100400)

版权

版权所有©《网络空间安全科学学报》编辑部 2024

Measurement the effect of anonymization techniques over databases

  • ZANG Shuai ,
  • ZHU Youwen , *
Expand
  • School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics, Nanjing 210016, China

Online published: 2024-11-16

Copyright

Copyright ©2024 Journal of Aeronautical Materials. All rights reserved.

摘要

当前,数据拥有者通常需要将自己收集到的数据交予其他机构进行数据分析或向公众发布。为了防止用户隐私信息的泄露,在发布或共享数据前,往往需要对数据进行匿名处理,达到一定隐私保护程度后才可安全发布。因此衡量发布数据的隐私保护水平是一项重要的研究内容。由于在以往的研究中,缺少足够通用的方案,不能对发布数据的隐私保护水平进行精确度量。因此提出了一种度量发布数据隐私保护程度方法,该方法主要通过条件熵与互信息,度量出数据处理前后的差异值,在此基础上基于互信息和联合熵融合得到具体的隐私保护效果,最终输出一个0~1范围的数值精确表示发布数据的隐私保护水平。将该方法应用到真实的数据集中,在匿名处理数据集使其满足常用的隐私模型后,分别度量不同隐私模型下数据各个属性的隐私保护水平,证明了所提方法的有效性。

本文引用格式

臧帅 , 朱友文 . 匿名数据集隐私保护效果度量机制[J]. 网络空间安全科学学报, 2024 , 2(3) : 67 -78 . DOI: 10.20172/j.issn.2097-3136.240306

Abstract

Nowadays, data owners often need to provide the data they have collected to other organizations for data analysis. To prevent the leakage of users' private information, data is typically anonymized before being published or shared, ensuring a certain level of privacy protection. Therefore, measuring the privacy protection level of published data is an important research topic. In previous studies, there has been a lack of sufficiently general methods to accurately measure the privacy protection level of published data. A method to measure the privacy protection level of published data was proposed. The method primarily uses conditional entropy and mutual information to measure the difference between the data before and after processing. The results are then substituted into a formula to obtain an accurate privacy protection level, ultimately calculating a number between 0 and 1 to precisely indicate the privacy protection level of the data. Finally, this method was applied to real datasets. After anonymizing the datasets to meet commonly used privacy models, the privacy protection level of each attribute was measured under different privacy models, thereby demonstrating the practicality of the method.

0 引言

当前,政府和企业需要统计分析大量的个人数据以便更加准确地做出决策,而这些数据在收集整理后,不仅有可能会在各组织之间传播,还有可能直接在公共领域发布。数据收集和发布的过程很容易泄露用户的隐私[1]。因此,在发布数据前,需要为这些数据提供足够的隐私保证。如发布人口普查数据、医院的患者治疗数据时[2],对这些数据进行有效的分析可以帮助政府进行政策的制定,还可以帮助医疗科研人员找到更好的疾病治疗方法。但是,这些数据往往含有大量的个人隐私信息,如家庭住址、病信息等。直接将数据给予研究组织会侵犯个人隐私。尽管直接能明确识别用户的属性往往会在发布前被删除,但在实际应用中,通过剩余的信息仍然有可能对应到个人数据[3]。为了避免上述问题的发生,隐私保护的数据统计分析(Privacy-Preserving Statistical Analysis,PPSA)研究应运而生。
在PPSA研究中,主要包含5种实体:数据提供方、数据管理方、数据使用方、隐私敌手、数据。数据提供方为数据的来源,通常为个人用户;数据管理方负责从数据提供方收集数据,并将数据进行脱敏处理后交给数据使用方;数据使用方通常为科研工作者;隐私敌手通常代表试图从数据中获取个人隐私数据的数据使用方,数据管理方也有可能是隐私敌手。
对数据的处理是整个隐私保护过程的关键,针对不同类型的数据,需要有不同的处理方式。一般需要公布的数据集属性可分为4类:识别符(Identifiers)、准识别符(Quasi-identifiers)、不敏感属性(Insensitive Attributes)、敏感属性(Sensitive Attributes)。识别符表示能明确识别受访者的属性(如身份证号),在数据发布前需要删除或部分删除该信息;准识别符表示可与外部来源或数据库相连接或结合,以重新识别用户的属性(如姓名、年龄、邮政编码),这些属性无法单独直接找到用户,但是这些属性结合起来,可降低找到用户的难度;敏感属性表示包含用户隐私信息的属性,其公开会导致直接侵犯用户隐私(如薪资、家庭住址);不敏感属性表示不包含任何用户隐私信息的属性。
按照隐私攻击的目标,隐私敌手的攻击主要可以分为身份攻击、属性攻击、存在性攻击和概率知识攻击4种。其中,身份攻击假定隐私敌手已有关于攻击目标的准识别符信息作为背景知识,且确定该攻击目标存在于数据管理方的数据集中,身份攻击期望从发布的数据集中得知攻击目标所对应的数据条目;属性攻击假定隐私敌手已知该攻击目标存在于数据管理方的数据集中,期望从发布的数据集或者查询结果中得知(或概率性地得知)攻击目标在数据集的属性值,相比于身份攻击,属性攻击不一定需要获取攻击目标对应的数据条目;存在性攻击期望从数据管理方发布的数据集或者查询结果中得知攻击目标是否存在于数据管理方的数据集中;概率知识攻击是在隐私敌手具有某些部分包含不确定性(概率性)的先验背景知识的情况下,期望通过分析数据管理方发布的数据集或者查询结果,降低背景知识的不确定性。
从以上4种攻击方式来看,隐私保护的核心目标是改变原始数据,从而增加隐私敌手从发布的数据中找到目标信息的难度[4]。而对原始数据进行处理,首先要删除识别符或者将识别符部分隐藏(如只显示部分身份证号或手机号),防止目标信息被直接定位。其次,降低准识别符的信息量,使得一条准识别符能对应出多个条目。同样也要降低隐私信息与准识别符的关联程度,使得准识别符对应的多个条目中,包含不同种类的隐私信息。对这些数据进行修改的过程,被统称为“消毒”( Sanitization) [1]
如今对隐私保护的方向已经有了相对完善的研究,正式确定了隐私的概念,同时也详细描述了隐私信息的性质[5]。数据集的隐私可以通过粗化个人信息、加入随机产生的噪声、在个别记录中交换值来实现保护。一些较常用的隐私模型包括k-匿名[6, 7]t-closeness[8]l-多样性[9]、Skyline privacy[5]、(α,β)-privacy[9]和差分隐私[10, 11]
与隐私信息泄露度量相关的文献也非常丰富。有基于匿名化的度量[12-16]。Issa等[16]将2个随机变量 $ X $$ Y $ 之间的隐私泄露定义为通过 $ Y $ 能导致猜中 $ X $的概率的增加量。这项工作随后被扩展到能猜中 $ X $ 的所有属性上,从而使隐私泄露最大化,由此产生的值被称为最大泄露,用 $ L\left(X\to Y\right) $表示。在他们的工作中,证明了$ L(X\to Y) $ 这个值等价于无穷阶的Sibson互信息。
Sondeck等[17]引入了一个以属性为中心的隐私度量,称其为识别率(Discrimination Rate),用于度量匿名后属性的识别能力(即通过准识别符找到隐私信息的能力),使用隐私信息与非隐私信息的条件熵和隐私信息的信息熵的比值表示隐私泄露程度。该研究虽然取得了较好的成果,但是其度量结果忽略了处理前隐私信息与处理后隐私信息的变化。如果对数据的隐私信息也进行了一定程度的处理,那么理论上其隐私保护程度应该更高,但在实际的度量结果中没有将该现象体现。
Sadhya[18]在最近的一项工作中根据识别率提出了更加详细的隐私度量方案。该方案不仅可以度量发布数据的隐私保护程度,还给出了基于此隐私程度的效用保留程度,并给出了隐私与效用之间的权衡方案。但是该方案的隐私保护程度的度量是基于一个比较严苛的假设前提,该假设前提要求数据在进行匿名处理时,必须要对隐私列进行处理,这导致了如果匿名方案中没有修改隐私属性,便无法使用该方案进行计算。因此该方案具有很大的局限性。
本文根据以上工作的启发,设计了一个更加通用的度量标准,能够更加精确地计算出匿名化处理后数据集的隐私保护程度,同时保证了方法的通用性,使其能在更多场景下使用。
具体而言,本文通过条件熵与信息熵,计算出数据处理前后具体的差异值与准识别符和隐私属性的联系程度,进而得到本文求得的数据隐私保护程度值 PL(Privacy Level)。首先,对匿名处理前后的数据集的各种属性按照类别进行划分,并分别做好标记。随后,定义了计算PL值的公式,该公式的核心目标是计算出通过准识别符信息得到隐私数据的难度和通过匿名后的隐私数据推理出原始的隐私信息的难度,二者的结合便是隐私保护水平,难度越高则表示隐私保护程度越高。将同一数据集的不同属性代入公式可得到不同的数值,进而得出不同属性的隐私保护水平,也就是局部隐私保护水平。将同类属性进行合并,并代入公式便得到数据集整体的隐私保护水平。

1 数据匿名模型

数据被发布前的处理过程统称为“消毒” [1]。“消毒”后的数据满足一定的隐私水平,从而可以安全发布。消毒的第一步,便是删除或粗化数据集的识别符,如身份证号等可以直接锁定到一个人的信息。然而,隐私敌手仍然可以通过其他公开的属性获得用户的隐私信息。这个问题促使人们开发出专门的技术,尽可能地抑制个人隐私的泄露风险,同时最大限度地保留数据的效用。
目前主流的消毒方法有两种:匿名(Anonymization)和扰动(Perturbation)。从信息熵的角度来看,匿名的核心目标是熵减,即通过模糊原始信息,使消毒后的数据信息熵减少,从而达到隐私保护的目的[8, 19]。匿名化机制可进一步分为泛化(Generalization)[7]和压制(Suppression)[20]两类。泛化方案将几个类别结合起来,形成一个新的不太具体的类别,如用户的年龄15可泛化为[10,20)。泛化虽然降低了数据的信息量,但是无论泛化程度如何,数据都一定是正确值。而压制则是删除一些记录或整个记录中的几个属性值,使得整体的信息量减小。
扰动的核心目标[21]是将原始数据与满足一定分布的噪声结合,从而产生一个合成输出。在大多数情况下,扰动后的数据信息熵会增加而非减少。噪声的大小需要根据实际情况严格控制,如果数据集过小或者对数据精度的要求较高,那么就不能有过大的噪声。目前同样有了较广泛的应用,如差分隐私[10]。在实际应用时,数据分析师查询到的数据往往是添加噪声后的数据,原始数据无法直接查询到[22]。在数据匿名模型中,保护程度往往与隐私敌手确定用户的数据是否存在于数据库中的能力有关。差分隐私机制[10]在数据查询时往往会被强制执行,执行该机制最主要的方法是拉普拉斯噪声机制[10]和指数机制[23]
本文提出的算法主要集中于度量使用匿名的方法进行消毒的数据,也就是熵减后数据的隐私保护程度。目前常用的数据匿名方法有3种,k-匿名、l-多样性与t-closeness。
(1)k-匿名:k-匿名要求发布的数据中,同一个准识别符至少要有 k 条记录。满足 k-匿名的数据能保证攻击者无法知道某个人的信息是否在公开的数据中。给定一个人,攻击者无法确认他是否有某项敏感属性,同样也无法确认某条数据对应的是哪个人。
不过 k-匿名无法防御以下攻击类型:同质化攻击(某个 k-匿名 组内对应的敏感属性的值也完全相同,这使得攻击者可以轻易获取想要的信息);背景知识攻击(即使 k-匿名组内的敏感属性值并不相同,攻击者也有可能依据其已有的背景知识以高概率获取到其隐私信息);未排序匹配攻击(当公开的数据记录和原始记录的顺序一样的时候,攻击者可以猜出匿名化的记录是属于谁,需要在发布时更改数据的顺序);补充数据攻击(假如公开的数据有多种类型,如果它们的 k-匿名方法不同,那么攻击者可以通过关联多种数据推测用户信息)。
因此,人们在此基础上提出了更加严格的匿名模型 l-多样性 。
(2)l-多样性:如果一个等价类里的敏感属性至少有l个良表示 (Well-Represented) 的取值,则称该等价类具有l-多样性。如果一个数据表里的所有等价类都具有l-多样性,则称该表具有 l-多样性。良表示可分为3类:可区分良表示、熵良表示、递归良表示。本文采用可区分良表示进行匿名,该方案要求同一等价类中的敏感属性要有至少有l个不同的取值。
(3)t-closeness:在数据表公开前,隐私敌手有对客户敏感属性的先验知识 (Prior Belief),数据表公开后观察者获得了后验知识 (Posterior Belief)。这两者之间的差别是观察者获得的信息增量 (Information Gain)。t-closeness 将信息获得又分为2个部分:关于整体的部分和关于特定个体的部分。
记观察者的先验知识为 $ {B}_{0} $,先发布一个抹去准识别符信息的数据表,这个表中敏感属性的分布记为 $ Q $,根据$ Q $,观察者得到了 $ {B}_{1} $;随后发布含有准识别符信息的数据表,那么观察者可以由准识别符识别特定个体所在的等价类,并可以得到该等价类中敏感属性的分布 $ P $,根据$ P $,观察者得到了 $ {B}_{2} $
t-closeness通过限制$ P $$ Q $的距离来限制$ {B}_{1} $$ {B}_{2} $的区别。如果 $ P=Q $,那么应有 $ {B}_{1}={B}_{2} $$ P\mathrm{和}Q $越近,$ {B}_{1}\mathrm{和}{B}_{2} $也应越近。如果等价类 $ E $ 中的敏感属性取值分布与整张表中该敏感属性的分布的距离不超过阈值t,则称 $ E $ 满足t-closeness。如果数据表中所有等价类都满足 t-closeness,则称该表满足t-closeness。

2 系统模型与基础知识

2.1 系统模型

本文使用 $ D $ 表示原始数据集。该数据集为一张表,表中有 $ K $ 列数据,每一列数据代表一种属性。 $ \mathcal{K} $ 表示所有属性的集合,表中共有 $ n $ 行数据。$ {X}^{k} $ 表示属性 $ k $ 的所有数据,$ k\in \mathcal{K} $$ {X}_{i} $ 表示第 $ i $ 行数据,$ i\in \{1,2,\cdots,n\} $ 。因此 $ {X}_{i}=\left({X}_{i}^{1},{X}_{i}^{2},\cdots ,{X}_{i}^{k}\right) $$ {X}^{k}=\left({X}_{1}^{k},{X}_{2}^{k},\cdots , {X}_{n}^{k}\right) $
属性集 $ \mathcal{K} $ 中的属性可划分为4类:识别符 $ {\mathcal{K}}_{\mathrm{i}\mathrm{d}} $、准识别符 $ {\mathcal{K}}_{\mathrm{q}\mathrm{d}} $、不敏感属性 $ {\mathcal{K}}_{\mathrm{p}\mathrm{u}\mathrm{b}} $、敏感属性 $ {\mathcal{K}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $。在匿名模型中,这4类属性是互斥的,满足 $ \mathcal{K}= {\mathcal{K}}_{\mathrm{i}\mathrm{d}}\cup {\mathcal{K}}_{\mathrm{q}\mathrm{d}}\cup {\mathcal{K}}_{\mathrm{p}\mathrm{u}\mathrm{b}}\cup {\mathcal{K}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $
然而在实际应用中,许多属性难以界定,如公开一个医院的疾病诊断数据,病人的年龄理论上不属于隐私属性,而是准识别符。但是有许多病人也不愿意透露自己的真实年龄,这就导致了这个属性既有可能是准识别符,也有可能是隐私属性。本文提到的度量模型也能够度量这种情况下准识别符的隐私泄露程度。
与原始数据集的表示略有不同,在本文中经过匿名后的数据集表示为 $ \overline{D} $ 。匿名后的数据表的4种不同的属性分别为:识别符 $ {\overline{\mathcal{K}}}_{\mathrm{i}\mathrm{d}} $、准识别符 $ {\overline{\mathcal{K}}}_{\mathrm{q}\mathrm{d}} $、不敏感属性 $ {\overline{\mathcal{K}}}_{\mathrm{p}\mathrm{u}\mathrm{b}} $、敏感属性 $ {\overline{\mathcal{K}}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $。同样,匿名后的数据表示为$ \overline{X} $
Snakar等[24]使用条件熵的方式定义了隐私$ \left(\mathcal{P}\right) $的具体概念:
$ \begin{array}{c}\mathcal{P}=H\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}}\mid {X}_{\mathrm{P}\mathrm{U}\mathrm{B}}\right)\end{array} $
式中 $ X\mathrm{_{prv}} $ 表示隐私数据, $ X\mathrm{_{PUB}} $ 表示数据集中除了隐私数据外的其他所有信息,包括识别符、准识别符、不敏感信息,这些信息都会减少隐私敌手获取隐私信息的难度;$ H\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}}\mid {X}_{\mathrm{P}\mathrm{U}\mathrm{B}}\right) $表示给定一些相关公共数据$ {X}_{\mathrm{P}\mathrm{U}\mathrm{B}} $后,隐私数据$ {X}_{\mathrm{p}\mathrm{r}\mathrm{v}} $剩余的信息量。
在本文的工作中同样使用了信息论的相关概念进行隐私度量,因此该隐私模型最适合本研究使用。此模型在度量隐私时,无需考虑数据处理过程,因此无论使用泛化还是微聚集的方式,都不会造成差异。处理后数据的不同分布与关联才会影响到度量结果。

2.2 基础知识

信息熵、条件熵、互信息和联合熵是信息论中的基本概念,用于衡量信息量的大小、不确定性和不同信息之间的关联程度。本文的隐私度量主要使用了这几个基本概念来度量数据集的隐私保护程度。本小节将简要介绍这几个概念,详细内容可参考文献[25]。
(1)信息熵:数据 $ X $ 的信息熵通常表示为 $ H\left(X\right) $。信息熵是衡量一个随机变量不确定性的量,表示了数据集 $ X $ 中包含的信息量。较高的信息熵意味着变量的不确定性较大,信息量也更大。在计算机中,信息熵可理解为表示事件 $ X $ 需要多少二进制位,公式为:
$ H\left(X\right)=-\displaystyle\sum _{x\in X}p\left(x\right){\mathrm{l}\mathrm{o}\mathrm{g}}_{2}p\left(x\right)$
其中,$ p\left(x\right) $表示事件$ x $发生的概率。从式(2)可以看出信息熵越大,表明要想了解这个信息,需要更多的数据,信息熵越小,则所需的数据量越少。
(2)条件熵:数据 $ X $$ Y $ 的条件熵可表示为 $ H\left(Y|X\right) $。条件熵是衡量在已知随机变量 $ X $ 的条件下,随机变量 $ Y $ 的不确定性。反映了当知道变量 $ X $ 的值时,变量 $ X $ 的剩余信息量。条件熵同样可以理解为在已知事件 $ X $ 后,表示事件 $ Y $ 需要多少二进制位,公式为:
$ \begin{aligned} H\left(Y\mid X\right)& =\displaystyle\sum _{x\in X}p\left(x\right)H\left(Y\mid X=x\right)\\ & =-\displaystyle\sum _{x\in X}p\left(x\right)\displaystyle\sum _{y\in Y}p\left(y\mid x\right){\mathrm{l}\mathrm{o}\mathrm{g}}_{2}p\left(y\mid x\right)\\ & =-\displaystyle\sum _{x\in X}\displaystyle\sum _{y\in Y}p\left(x,y\right){\mathrm{l}\mathrm{o}\mathrm{g}}_{2}p\left(y\mid x\right)\end{aligned} $
(3)互信息:数据 $ X $$ Y $ 的互信息可表示为$ I\left(X;Y\right) $ 。互信息用于衡量两个随机变量之间共享的信息量,即知道变量 $ Y $ 的值后,能减少对变量 $ X $ 不确定性的多少,反之亦然。互信息的公式为:
$ \begin{aligned} I\left(X;Y\right)& =\sum _{x,y}p\left(x,y\right){\mathrm{l}\mathrm{o}\mathrm{g}}_{2}\frac{p\left(x,y\right)}{p\left(x\right)p\left(y\right)}\\ & =H\left(Y\right)-H\left(Y\mid X\right)\\ & =H\left(X\right)-H\left(X\mid Y\right)\end{aligned} $
(4)联合熵:数据 $ X $$ Y $ 的联合熵可表示为$ H\left(X,Y\right) $ 。联合熵用于衡量两个随机变量 $ X $$ Y $ 作为一个整体的不确定性,代表同时表示 $ X $$ Y $ 时,所需要的信息量。联合熵的公式为:
$ H\left(X,Y\right)=-\sum _{x,y}p\left(x,y\right){\mathrm{l}\mathrm{o}\mathrm{g}}_{2}p\left(x,y\right) $
式中,$ p\left(x,y\right) $$ X $$ Y $ 的联合概率分布。

3 隐私度量

本文的隐私度量机制可分为度量整体数据的隐私保护程度和度量个别关键属性的隐私保护程度。而隐私度量主要是通过度量隐私属性与其余属性的识别率,再结合原始隐私数据与匿名后隐私数据之间的差异,得出匿名数据的隐私泄露量。

3.1 整体隐私保护程度的度量

为了便于计算,将属性值视为离散随机变量集合,而匿名后的数据集可被视为另一个数据类型相对更少的离散随机变量集。通过式(1)对隐私的定义可知,保护隐私的核心是减少公开数据与隐私数据之间的联系。因此,隐私保护程度的度量,便是要度量出公开信息与原始隐私信息的联系。
在算法 1 中,给出了度量整体隐私保护程度的方法。首先,需要度量出隐私属性 $ {\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $ 与准识别符 $ {\overline{X}}_{\mathrm{p}\mathrm{d}} $ 的识别率 [17]。通过识别率度量隐私泄露程度的目标在于,在获得了准识别符的情况下,能够获得多少对隐私信息的认识,并减少多大隐私信息的信息熵减少了多少。信息熵减少得越多,说明准识别符提供的信息越多,隐私泄露能力越强。
不过,单纯度量出识别率无法真正确定隐私泄露程度,因为在真实的数据匿名过程中,被匿名的数据,往往不止准识别符信息,隐私信息同样可以被处理,处理后的隐私信息即使被泄露,也不能认定用户的真正隐私信息被泄露。因此在度量隐私泄露程度时,首先要基于发布的数据,度量发布信息的泄露程度,再结合原始隐私信息与匿名后隐私信息的差异,得出最终的隐私泄露结果,如式(6)所示:
$ (\overline{D})=\left(1-\frac{H\left(\overline{X}_{\mathrm{prv}} \mid \overline{X}_{\mathrm{pd}}\right)}{H\left(\overline{X}_{\mathrm{prv}}\right)}\right) \times \frac{I\left(X_{\mathrm{prv}}, \overline{X}_{\mathrm{prv}}\right)}{H\left(X_{\mathrm{prv}}\right)} $
式中, $ H\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}|{\overline{X}}_{\mathrm{p}\mathrm{d}}\right) $ 表示隐私列与准识别符列的条件熵,用来表示在数据经过匿名并发布后,隐私敌手可通过发布的准识别符信息减少隐私信息的信息熵大小,$ H\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right) $为匿名后隐私信息的信息熵,$ H\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\mid {\overline{X}}_{\mathrm{p}\mathrm{d}}\right)/ \mathrm{H}\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right) $ 为隐私信息剩余的比例,其值越大,表明准识别符对定位隐私信息提供了较小的帮助,最大值为 1,其值较小时,表明即使在数据匿名处理后,准识别符还是能大量降低隐私信息的信息熵,隐私敌手仍然很容易获取隐私信息。由于二者的比值在 0 到 1 之间,因此在 1 减去二者的比值便是识别率。识别率越高,隐私保护程度越高。 DR=1时,每个准识别符都能直接定位到一个信息,可将该准识别符视为识别符; DR=0时,被称为零识别符,此时该数据无法提供任何信息,大多数情况下,此时所有准识别符信息完全相同,数据已经丧失效用。
$ I\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}},{\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right) $ 度量的是原始隐私数据与匿名后隐私数据的互信息,可认为是数据在经过匿名处理后,原始信息中被保留的信息量,该值会随着匿名程度的增加而减小。若该数据未经处理,那么二者的互信息与原始数据的信息熵应相同,即 $ I\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}},{\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right) $$ H\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right) $ 的比值为 1。此时若匿名后的隐私被泄露,那么同样可被认为原始的隐私信息被泄露。
由上述描述可知,乘法左右的数据都是在接近于 1 的时候隐私泄露程度最高,同时在接近于 0 的时候隐私泄露程度最小。因此最终得出的隐私保护水平 PL$ \left(\overline{D}\right) $值也在0~1之间。越接近于 0,表明隐私保护水平较高;越接近于 1,表明隐私保护水平较低。具体地,整体隐私保护程度度量的计算过程如算法1所示。
算法1 整体隐私保护程度的度量
输入:
匿名前数据$ D $、匿名后数据 $ \overline{D} $、准识别符集合 $ {\mathcal{K}}_{qd} $、敏感属性 $ {\mathcal{K}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $
输出: $ { PL\left(\overline{D}\right)} $
$ { l\leftarrow \left|{\mathcal{K}}_{{\mathrm{qd}}}\right|} $
$ {m\leftarrow \left|{\mathcal{K}}_{{\mathrm{prv}}}\right|\qquad\qquad\qquad}$
for $ ({x}_{1},{x}_{2},\cdots ,{x}_{m}) $ in $ {\overline{D}[{\mathcal{K}}_{{\mathrm{prv}}}^{1},{\mathcal{K}}_{{\mathrm{prv}}}^{2},\cdots ,{\mathcal{K}}_{{\mathrm{prv}}}^{m}]} $ do
$\quad {{\overline{X}}_{{\mathrm{prv}}}\left[i\right]=({x}_{1},{x}_{2},\cdots ,{x}_{m})} $
for $ ({x}_{1},{x}_{2},\cdots ,{x}_{l}) $ in $ { \overline{D}[{\mathcal{K}}_{{\rm{pd}}}^{1},{\mathcal{K}}_{{\rm{pd}}}^{2},\cdots ,{\mathcal{K}}_{{\rm{pd}}}^{l}]}$ do
$\quad { {\overline{X}}_{{\rm{pd}}}\left[i\right]=({x}_{1},{x}_{2},\cdots ,{x}_{l}) }$
for $({x}_{1},{x}_{2},\cdots ,{x}_{m})$ in $ { D[{\mathcal{K}}_{{\rm{prv}}}^{1},{\mathcal{K}}_{{\rm{prv}}}^{2},\cdots ,{\mathcal{K}}_{{\rm{prv}}}^{m}] }$ do
$\quad{X}_{{\rm{prv}}}\left[i\right]=({x}_{1},{x}_{2},\cdots ,{x}_{m})$
DR = $ {1-\dfrac{H\left({\overline{X}}_{{\rm{prv}}}|{\overline{X}}_{{\rm{pd}}}\right)}{H\left({\overline{X}}_{{\rm{prv}}}\right)}}$
IR = $ {\dfrac{I\left({X}_{{\rm{prv}}},{\overline{X}}_{{\rm{prv}}}\right)}{H\left({X}_{{\rm{prv}}}\right)}}$
return DR$ \times $IR

3.2 局部隐私保护程度的度量

上述的隐私属性与准识别符属性只适用于大多数情况。如第3.1 节所述,在实际应用中,数据的隐私属性与准识别符属性并非互斥的。一个数据在某些情况下可同时被视为隐私属性与准识别符属性,因此在对数据类型进行划分时,也要考虑到一些特殊情况。
在算法2中,给出了度量局部隐私保护程度的方法。该方法可用于单独度量想要计算的属性的隐私。假定X为隐私数据,Y为隐私敌手已经知道的隐私数据。那么局部隐私保护水平的计算公式可由公式变形而来:
$ P{L}_{Y}\left(\overline{X}\right)=\left(1-\frac{H\left(\overline{X}|\overline{Y}\right)}{H\left(\overline{X}\right)}\right)\times \frac{I\left(X,\overline{X}\right)}{H\left(X\right)} $
局部隐私程度度量方式与整体隐私保护程度度量的公式类似,只是将隐私属性替换为任意属性 $ X $ ,对于大多数人都默认的非隐私属性,如出生年月、生活地区等也可代入,对于一些特殊人群的隐私也需要进行度量。文中将准识别符属性替换为除隐私属性外的其他任意属性集Y,该属性是大多数情况下每个人都能合法获取到的属性,如手机号、邮箱等。算法2展示了局部隐私保护效果度量的计算过程。
算法2 局部隐私保护程度的度量
输入:
匿名前数据$ D $、匿名后数据 $ \overline{D} $、准标识符集合$ {\mathcal{K}}_{\mathrm{q}\mathrm{d}} $、敏感属性 $ {\mathcal{K}}_{\mathrm{p}\mathrm{r}\mathrm{v}} $
要度量的属性:$ {\mathcal{K}}_{} $
输出: $ {{\mathrm{PL}}\left(\overline{X}\right)} $
$ {l\leftarrow \left|{\mathcal{K}}_{\mathrm{q}\mathrm{d}}\right|} $
if $ {\mathcal{K}}_{} $ in $ {\mathcal{K}}_{\mathrm{q}\mathrm{d}} $
$\quad {l=l-1} $
$ \quad{{\mathcal{K}}_{\mathrm{q}\mathrm{d}}={\mathcal{K}}_{\mathrm{q}\mathrm{d}}-{\mathcal{K}}_{\mathrm{q}\mathrm{d}} }$
${ \overline{X}=\overline{D}\left[\mathcal{K}\right]} $
$ {X=D\left[\mathcal{K}\right]} $
for $ ({x}_{1},{x}_{2},\cdots ,{x}_{l}) $ in $ {\overline{D}[{\mathcal{K}}_{\mathrm{p}\mathrm{d}}^{1},{\mathcal{K}}_{\mathrm{p}\mathrm{d}}^{2},\cdots ,{\mathcal{K}}_{\mathrm{p}\mathrm{d}}^{\mathrm{l}}] }$ do
$\quad{ \overline{Y}\left[i\right]=({x}_{1},{x}_{2},\cdots ,{x}_{l})} $
DR = ${ 1-\dfrac{H\left(\overline{X}|\overline{Y}\right)}{H\left(\overline{X}\right)} }$
IR = $ {\dfrac{I\left(X,\overline{X}\right)}{H\left(X\right)}} $
return DR$ \times $IR

4 隐私保护度量实例分析

本节将使用一个简单的样例来说明本文的度量方法在不同的隐私模型中的度量结果。在3个常用的匿名模型上进行实验,即 k-匿名、l-多样性 和 t-closeness。

4.1 数据匿名结果

表1为原始数据表,表2为数据匿名处理后可用于发布的结果。表中数据选自于文献[8],表1共有 4 列,分别邮政编码、年龄、薪资、疾病。邮政编码列与年龄列均没有重复值,也就是说这两列数据均可作为识别符使用。薪资与疾病为隐私数据列,隐私保护的核心,便是防止隐私敌手通过已知的相关信息将某一行的隐私数据与某个用户对应上。
表 1 原始数据

Table 1 Raw Data

序号 邮政编码 年龄 薪资 疾病
1 47677 29 3000 gastric ulcer
2 47602 22 4000 gastritis
3 47678 27 5000 stomach cancer
4 47905 43 6000 gastritis
5 47909 52 11000 flu
6 47906 47 8000 bronchitis
7 47605 30 7000 bronchitis
8 47673 36 9000 pneumonia
9 47607 32 10000 stomach cancer
表 2 匿名数据

Table 2 Anonymous Data

序号 邮政编码 年龄 薪资 疾病
1 4767* $\leqslant $40 3000 gastric ulcer
2 4767* $\leqslant $40 4000 gastritis
3 4767* $\leqslant $40 5000 stomach cancer
4 4790* $\geqslant $40 6000 gastritis
5 4790* $\geqslant $40 11000 flu
6 4790* $\geqslant $40 8000 bronchitis
7 4760* $\leqslant $40 7000 bronchitis
8 4760* $\leqslant $40 9000 pneumonia
9 4760* $\leqslant $40 10000 stomach cancer
表2为处理后的数据,邮政编码列的数据均只精确到倒数第2位,最后1位置为“*”。年龄列不再提供精确的年龄,而是以 40 为界,提供年龄的范围。这样修改后,准识别符列虽然有 9 组数据,却只存在 3 个不同的元组:{(4767*,$\leqslant $40),(4790*,$\geqslant $40),(4760*,$\leqslant $40)} ,每个元组有 3 行数据。该数据满足 3-匿名 ,此时隐私敌手无法确认自己手中的数据精确属于哪一个用户,每次只能锁定 3 行。如隐私敌手知道被攻击用户的邮政编码与年龄为(4767*,$\leqslant $40),然而从公开的数据来看,1~3行均满足要求,无法确定用户的薪资与疾病。同时,处理后的数据满足 3-多样性 ,因为每条修改后的准识别符,都能找到 3 组不同的隐私数据。如(4767*,$\leqslant $40)对应 3 组不同的数据:{(3000,gastric ulcer),(4000,gastritis),(5000,stomach cancer)},其他几个准识别符元组同理。同时,表中的薪资列满足 0.167-closeness,疾病列满足 0.278-closeness。疾病列内有更多的重复数据,因此 t 值相对较高。

4.2 隐私保护水平度量

由于所使用的数据集较小,可较为直观地观察到原始数据集与处理后数据集的差异。而隐私保护水平可直接进行计算。基于上述方法与数据,本节对一些关键的隐私保护水平进一步进行度量。
整体隐私保护程度的度量。隐私列为薪资、疾病,准识别符列为邮政编码、年龄。将两列数据合成为 1 列数据,同一行的数据合成为 1 个元组。代入式(6)可得:
$ {\mathrm{PL}}\left(D\right)\approx \left(1-1.58/3.17\right)\times 3.17/3.17=0.5 。 $
由于两个隐私列的数据在匿名前后并没有任何变化,因此,匿名前后隐私数据的互信息与原始隐私信息的信息熵完全相等,即匿名后的隐私信息与原始信息呈一一对应的关系。$ \dfrac{H\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}|{\overline{X}}_{\mathrm{p}\mathrm{d}}\right)}{H\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right)}\approx 0.5 $ 表明隐私敌手可以通过匿名后的准识别符缩小隐私信息的范围,但是无法直接确定一个准识别符。各个计算值都符合实际情况。
薪资列与准识别符列的隐私水平。$ {\mathrm{P{L}}}_{{K}_{\mathrm{p}\mathrm{d}}}\left({K}_{\mathrm{S}}\right)\approx \left(1-1.58/3.17\right)\times 3.17/3.17=0.5 $ 。可以观察到,$ {\mathrm{P{L}}}_{{K}_{\mathrm{p}\mathrm{d}}}\left({K}_{\mathrm{S}}\right) \mathrm{与}{\mathrm{PL}}\left(D\right) $ 不仅结果相同,计算单元也完全相同。这是由于两组计算的准识别符列完全相同,而整个数据的隐私列构成的元组列表(薪资,疾病)有 9 个不同的值,单个薪资同样也有 9 个不同的值,导致了量列的信息熵与条件熵相同。
疾病列与准识别符列的隐私水平。$ {\mathrm{P{L}}}_{{K}_{\mathrm{p}\mathrm{d}}}\left({K}_{D}\right)\approx \left(1-1.58/2.50\right)\times 2.50/2.50=0.37 $。对疾病列的隐私保护水平的计算与薪资不同,疾病列仅有 6 个不同的数据,导致了该列的信息熵要低于薪资列,理论上更容易发生隐私泄露。然而该列与准识别符的条件熵和薪资列与准识别符的条件熵相等,说明通过准识别符,对薪资列的了解程度会有所增加,但是信息量更少的疾病列也会增加到同样的水平,表明该列的隐私保护水平要高于薪资列。这与实际情况相符,由于匿名后的数据满足 3-多样性,隐私敌手通过准识别符,与薪资列相同也只能锁定 3 个不同的 疾病信息。
年龄列与邮政编码列的隐私水平。$ {\mathrm{P{L}}}_{{K}_{Z}}\left({K}_{A}\right)\approx \left(1- 0/0.92\right)\times 0.92/3.16=0.29 $ 。与上述 3 个度量不同,年龄列并非隐私属性,在进行数据匿名时,虽然对该列进行了处理,但处理的目的是保证隐私列的数据达到标准,并非该列数据。在实际情况中,年龄列数据会被部分用户当成隐私数据,因此有必要对该列的隐私保护情况进行度量。 可以看出,匿名后的 年龄列与邮政编码列呈现严格的一一对应的关系,即知道邮政编码值后,可以直接定位到年龄,但这并不代表数据被完全泄露,因为该列数据进行了熵减处理,其与原始数据有很大的差异,原始数据有9个不同的值,而匿名后仅有2个不同的值,每个值不再精确到个位,而是一个范围,这使得隐私保护效果同样有很大的提高。

5 实验

本节使用一个常用的大规模的数据集,再将其调整,满足各种数据的匿名模型后,度量其隐私保护效果,以及观测度量值与真实值的差异。本节详细介绍了实验中使用的数据集匿名化机制,以及数据匿名的详细方法,包括属性分类和用于数据匿名的工具。

5.1 数据集

数据集选用成人数据集[26],该数据集是从1994年美国人口普查数据库中提取的,它由15个数字和分类属性组成,共32561行。但是,在删除包含丢失信息和没有特定作用的属性之后,选择了该数据集的一个子集。
最后选用的成人数据集的子集有30162行和10个属性:索引、年龄、工作类型、教育程度、母国国籍、职业、种族、性别、薪资和婚姻状态。其中索引属性为数据集的识别符,教育程度和母国国籍为敏感属性也就是隐私属性。其余属性为准识别符。数据集的具体信息见表3
表 3 数据集的信息

Table 3 Information on the dataset

序号 类型 属性 不同值数量 符号
1 索引 识别符 30162 $ {K}_{1} $
2 年龄 准识别符 74 $ {K}_{2} $
3 工作类型 准识别符 8 $ {K}_{3} $
4 教育程度 敏感属性 16 $ {K}_{4} $
5 母国国籍 敏感属性 41 $ {K}_{5} $
6 职业 准识别符 14 $ {K}_{6} $
7 种族 准识别符 5 $ {K}_{7} $
8 性别 准识别符 2 $ {K}_{8} $
9 薪资 准识别符 2 $ {K}_{9} $
10 婚姻状况 准识别符 7 $ {K}_{10} $
11 不敏感属性
本实验将使用软件 ARX [27]对数据进行匿名化处理,该软件为开源的敏感数据匿名软件。在整个处理过程中,设置匿名的方法为泛化,使得数据满足k-匿名、l-多样性、t-closeness3种常用的隐私模型。

5.2 隐私度量结果

本节将以上不同匿名模型所得到的结果代入本文提出的度量算法中,并将度量结果绘制成折线统计图,通过统计结果分析不同匿名模型下隐私保护水平的规律。详细的度量数据在附录中。

5.2.1 度量满足k-匿名的数据集

选择 $ k=\{2,3,4,5,6,7\} $ 进行实验。其中教育程度、母国国籍为隐私属性,索引为识别符,其余属性为准识别符。发布时满足k-匿名的隐私属性PL值如图1所示,将删除索引列,因此在计算时忽略该列的信息。
图1 可以看出,随着 k 值的不断增加,整体的 PL 值与两个隐私属性的 PL 值都在不断减少,而在 k-匿名[28]中,数据的隐私保护程度会随着 k值的增加而增加,这完全符合 k-匿名的规则。
图 1 满足 k-匿名的隐私属性 PL 值

Fig.1 PL of Privacy attributes satisfying k-anonymity

图2为满足k-匿名的准识别符属性PL值,从图2 可以看出,虽然没有对其余属性进行专门的隐私保护处理,但是在匿名的过程中,这些准识别符数据也进行了一定程度的泛化,导致信息熵发生了减少,其 PL 值虽然没有严格按照 k 值的变化而变化,却都小于 1。
图 2 满足 k-匿名的准识别符属性 PL 值

Fig.2 PL of Quasi-identifier attributes satisfying k-anonymity

5.2.2 度量满足l-多样性的数据集

选择 $ l=\{2,3,4,5,6,7\} $ 进行实验,且教育程度与国籍两个隐私属性都要满足 l-多样性,即一个准识别符至少要对应出 l 种不同的教育程度与国籍。
图3为满足l-多样性的隐私属性PL值,图3从整体上看,两个隐私属性与整体的隐私保护程度都随着 l 值的增加而增加。图4 为满足l-多样性的准识别符属性PL值,表明准识别符的隐私保护程度与 k-匿名类似也都小于1,但是并没有与 l 值有着较大的关联。由于 l-多样性相比 k-匿名对准识别符要有着更加严格的处理,即使l取最小值 2 时的隐私保护程度也大于图1k=16 时的隐私保护程度。
图 3 满足 l-多样性 的隐私属性 PL 值

Fig.3 PL of Privacy attributes satisfying l-diversity

图 4 满足 l-多样性的准识别符属性PL 值

Fig.4 PL of Quasi-identifier attributes satisfying l-diversity

5.2.3 度量满足t-closeness的数据集

选择 $ t=\{0.05,0.1,0.15,0.2,0.25,0.3\} $ 进行实验。两个隐私属性的 $ t $ 值相同,其隐私保护程度随着 t 值的增加而减少。
与前两个匿名方式不同,t-closeness的理论隐私保护程度随着 t 值的增加而增加,因此如图5 所示,最终得到的曲线是单调递增的。而图6 中几条非隐私属性的 PL 曲线和前两个匿名方式相比,有着更强的规律性。虽然其并不是严格的单调递增曲线,但是可以很明显地看出都在波动中逐渐上升。当 t=0.05 时,PL 值达到极小,查看数据后发现,大部分数据匿名到了最高层级。
图 5 满足 t-closeness 的隐私属性PL 值

Fig.5 PL of privacy attributes satisfying t-closeness

图 6 满足 t-closeness的准识别符属性PL 值

Fig.6 PL of quasi-identifier attributes satisfying t-closeness

通过观察 3 幅图可以发现,无论是哪种匿名方式,母国国籍属性的PL 值一直是最大的,整体的 PL 值居中,教育程度的 PL 值最小。这主要是由于母国国籍属性有着更多种类的值,因此在进行匿名时,对准识别符进行更少的处理即可达到要求,处理更少,表明隐私保护程度相对较低。

5.2.4 PL 值与信息熵变化

数据的匿名程度并不是越高越好。过高的匿名程度会使得数据的信息量损失过大,进而使得数据的效用降低。因此,在对数据进行隐私保护处理时,需要考虑数据信息熵的变化,尽量将信息熵的减小控制到一个合理的范围。
在大多数情况下,数据的隐私保护程度与数据信息熵的保留大小成反比,即数据的信息量越小,隐私保护程度越高。但实际上二者并非严格的反比关系,根据式(2),隐私泄露的核心在于公开的信息与隐私信息之间联系的紧密程度而非公开信息的信息熵。因此,使用较好的数据匿名方法,可以在满足隐私保护程度的同时保留更多的信息量。
数据处理前后信息熵的比值(Entropy Change, EC)为:
$ {\mathrm{EC}}\left(\overline{D}\right)=\dfrac{H\left({\overline{X}}_{\mathrm{p}\mathrm{d}}\right)+H\left({\overline{X}}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right)}{H\left({X}_{\mathrm{p}\mathrm{d}}\right)+H\left({X}_{\mathrm{p}\mathrm{r}\mathrm{v}}\right)} $
虽然不同的隐私模型往往有不同的匿名标准,k、t、l 之间的值无法直接进行比较。但是可以通过信息熵的变化将三者结合,从而忽略隐私模型的不同,直接对其隐私与信息量进行比较。隐私保护水平与信息熵变化的对比如图7所示。
图 7 隐私保护水平与信息熵变化的对比

Fig.7 Comparison between privacy level and information entropy

在理论上,数据所达到的匿名程度越高,数据的隐私保护程度越高,数据所剩余的信息量越小。但是,如图7 所示,由于不同的匿名程度在实际处理时所采用的方法会有差异,因此即使最终达到了相同的匿名程度,实际信息熵的保留程度也会有一定的不同,并不会按照理论上的保护程度发展。由图7可以看出,在总体趋势上,隐私保护程度与信息熵的保留程度呈现负相关,不过仍有 3 个值由于匿名算法的原因导致整体曲线有较大的波动。因此对隐私数据的处理方式也更加重要,以防止出现隐私保护程度与效用保留程度同时很差的现象。

6 结束语

本文提出了一个相对通用的隐私度量框架,用于度量数据匿名前后的隐私保护程度,从而保证将要发布的数据不会发生较严重的隐私泄露。本文提出的隐私水平的度量仅仅需要对比数据匿名前后的差异,并不需要知道整体的匿名化过程,因此保证了方法的通用性。实验部分使用了一个开源的数据集对我们的方法进行验证,并得出了参数与隐私保护程度的关系,确保度量结果的真实性。目前,本文所提出的度量方法还无法适用于对熵增数据的隐私度量。在未来的工作中,我们将会着重于对熵增数据隐私的度量,归纳得出一个同时满足于熵增与熵减的度量方法。
1
FUNG B CM, WANG K, CHEN R, et al. Privacy-preserving data publishing: A survey of recent developments[J]. ACM Computing Surveys (Csur), 2010, 42 (4): 1- 53.

2
KANWAL T, ANJUM A, MALIK S U R, et al. A robust privacy preserving approach for electronic health records using multiple dataset with multiple sensitive attributes[J]. Computers & Security, 2021, 105, 102224.

3
SWEENEY L. Statement before the privacy and integrity advisory committee of the department of homeland security[J]. Dept. Homeland Security,2005.

4
BERTINO E,LIN D,JIANG W. A survey of quantification of privacy preserving data mining algorithms[J]. Privacy-Preserving Data Mining:Models and Algorithms,2008:183-205.

5
CHEN B C,LEFEVRE K,RAMASKRISHNAN R. Privacy skyline:Privacy with multidimensional adversarial knowledge[R]. University of Wisconsin-Madison Department of Computer Sciences,2007.

6
SWEENEY L. K-anonymity: A model for protecting privacy[J]. International Journal of Uncertainty, Fuzziness and Knowledge-based Systems, 2002, 10 (5): 557- 570.

DOI

7
ZHOU KY, YANG YX, QIAO Y, et al. Mixstyle neural networks for domain generalization and adaptation[J]. International Journal of Computer Vision, 2024, 132(3): 822-836.

8
LI N,LI T,Venkatasubramanian S. T-closeness:Privacy beyond k-anonymity and l-diversity[C]//2007 IEEE 23rd international conference on data engineering. IEEE,2006:106-115.

9
MACHANAVAJJHALA A, KIFER D, GEHRKE J, et al. l-diversity: Privacy beyond k-anonymity[J]. Acm Transactions on Knowledge Discovery From Data (tkdd), 2007, 1 (1): 3- es.

DOI

10
EVFIMIEVSKI A,GEHRKE J,SRIKANT R. Limiting privacy breaches in privacy preserving data mining[C]//Proceedings of the twenty-second ACM SIGMOD-SIGACT-SIGART symposium on Principles of database systems,2003:211-222.

11
ZHANG Y, ZHU Y, Zhou Y, et al. Frequency estimation mechanisms under ϵδ-utility-optimized local differential privacy[J]. IEEE Transactions on Emerging Topics in Computing, 2023, 12(1): 316-327.

12
GHINITA G,KALNIS P,SKIADOPOULOS S. PRIVE:Anonymous location-based queries in distributed mobile systems[C]//Proceedings of the 16th international conference on World Wide Web,2007:371-380.

13
DWORK C. Differential privacy[C]//International Colloquium on Automata,Languages,and Programming. Berlin,Heidelberg:Springer Berlin Heidelberg,2006:1-12.

14
GRUTESER M,GRUNWALD D. Anonymous usage of location-based services through spatial and temporal cloaking[C]//Proceedings of the 1st International Conference on Mobile Systems,Applications and Services,2003:31-42.

15
ZHU YW,SONG QM,LUO YL. Differentially private top-k flows estimation mechanism in network traffic,IEEE Transactions on Network Science and Engineering,2024,11(3) 2462-2472

16
ISSA I, KAMATH S, WAGNER A B. An operational measure of information leakage[C]//2016 Annual Conference on Information Science and Systems (CISS). IEEE, 2016: 234-239.

17
SONDECK L P, LAURENT M, FREY V. Discrimination rate: an attribute-centric metric to measure privacy[J]. Annals of Telecommunications, 2017, 72, 755- 766.

DOI

18
SADHYA D, CHAKRABORT B. Quantifying the effects of anonymization techniques over micro-databases[J]. IEEE Transactions on Emerging Topics in Computing, 2022, 10 (4): 1979- 1992.

DOI

19
LI N,LI T,VENKATASUBRAMANIAN S. T-closeness:Privacy beyond k-anonymity and l-diversity. [C]// 2007 IEEE 23rd International Conference on Data Engineering,IEEE,2007:106–115.

20
ZHU YW, CAO YR , XUE Q, et al. Heavy hitter identification over large-domain set-valued data with local differential privacy[J]. IEEE Transactions on Information Forensics and Security, 2024, 19: 414-426.

21
SAMARATI P, SWEENEY L .Protecting privacy when disclosing information:k- anonymity and its enforcement through generalization and suppression. Technical repor[J]. SRI International,1998.

22
DWORK C,MCSHERRY F,NISSIM K,et al. Calibrating noise to sensitivity in private data analysis[C]//Theory of Cryptography:Third Theory of Cryptography Conference,2006:265-284.

23
MCSHERRY F T K. Mechanism design via differential privacy//Proceeding soft the 48th Annual IEEE Symposium on Foundations of Computer Science[J]. IEEE Computer Society, 2007, 94, 103.

24
SANKAR L, RAJAGOPALAR S R, POOR H V. Utility-privacy tradeoffs in databases: An information-theoretic approach[J]. IEEE Transactions on Information Forensics and Security, 2013, 8 (6): 838- 852.

DOI

25
KOLMOGOROV A. On the Shannon theory of information transmission in the case of continuous signals[J]. IRE Transactions on Information Theory, 2016, 2 (4): 102- 108.

26
MOHIT R R V, KATOCH S, VANJARE A, et al. Classification of complex UCI datasets using machine learning algorithms using hadoop[J]. International Journal of Computer Science and Software Engineering, 2015, 4 (7): 190- 198.

27
PRASSER F,KOHLMAYER F. Putting statistical disclosure control into practice:The ARX data anonymization tool[J]. Medical Data Privacy Handbook,2015:111-148.

28
DI VIMERCATI S D C, FORESTI S, LIVRAGA G, et al. K-anonymity: From theory to applications[J]. Transcation on Data Privacy, 2023, 16 (1): 25- 49.

文章导航

/