知识卡片

假名化、匿名化与k-匿名化

专业/工作 · 916.e

内容

大多数商业分析并不需要知道”这条数据具体对应谁”,只需要统计规律,这为个人信息的”降级使用”提供了空间,但降级的程度不同、能做的事也不同。假名加工信息是指经过加工后,如果不对照其他信息就无法识别出具体某个人,但理论上仍有被还原的可能——这种加工叫假名化,只能作为内部分析数据使用,向第三方提供会受到限制;匿名加工信息则是彻底无法复原、无法识别特定个人,这种加工叫匿名化,公开给第三方时必须公示加工中包含了哪些个人相关项目(用于统计目的则可以豁免这个公示义务)。k-匿名化是实现匿名化的具体手段之一:把数据处理成”任意一条记录都至少有k-1条其他记录与它在关键属性上完全相同”,让每个人都淹没在至少k个”看起来一样”的人群里,从而无法被单独锁定。发散:k-匿名化的巧妙之处在于不是删除信息,而是主动制造”同质化的模糊区间”,用群体的不可区分性来保护个体。

参考来源

《图解数据科学》第6章《有关安全与隐私的问题》