《電子技術應用》
您所在的位置:首頁 > 通信与网络 > 设计应用 > 基于信息熵的数据集重标识风险评估方法
基于信息熵的数据集重标识风险评估方法
2020年信息技术与网络安全第12期
陈 磊1,2,薛见新1,2,张润滋1,2,刘文懋1
1.绿盟科技集团股份有限公司,北京100089;2.清华大学 自动化系,北京100084
摘要: 去标识化作为一种隐私保护技术,在数据发布领域得到了广泛应用。然而,在大数据时代下,攻击者可能获得了更多的关联数据,去标识数据集仍然存在重标识攻击的风险。基于Shannon信息熵,并结合信息安全风险评估框架,提出了一种综合的重标识风险评估方法。首先,将攻击者可能利用的数据集的各种属性组合归纳为若干个脆弱性,然后逐一对这些脆弱性从可能性和危害性两个维度进行评估。最后,为了综合评估整个数据集的重标识风险,构造了一种基于熵值增量和加权的评估算法。实验结果表明,所提评估方法可全面、直观地反映风险分布与趋势。
中圖分類號: TP399
文獻標識碼: A
DOI: 10.19358/j.issn.2096-5133.2020.12.001
引用格式: 陳磊,薛見新,張潤滋,等. 基于信息熵的數據集重標識風險評估方法[J].信息技術與網絡安全,2020,39(12):1-7.
Re-identification risk assessment of de-identified datasets based on information entropy
Chen Lei1,2,Xue Jianxin1,2,Zhang Runzi1,2,Liu Wenmao1
1.Nsfocus Information Technology Co.,Ltd.,Beijing 100089,China; 2.Department of Automation,Tsinghua University,Beijing 100084,China
Abstract: As a privacy protection technology, de-identification has been widely used in data publishing scenarios. However, in the era of big data, attackers may obtain more associated data, and there is still a risk of re-identification attacks on de-identified datasets. Based on information entropy and information security risk assessment framework, this paper proposes a comprehensive re-identification risk assessment method. Firstly, the various attribute combinations of a de-identified dataset that attackers may utilize are summarized into several vulnerabilities, and then these vulnerabilities are evaluated one by one from probability and impact dimension. Finally, in order to comprehensively evaluate the re-identification risk of the dataset, this paper constructs a fast evaluation algorithm based on entropy increments and weights. Extensive experimental results demonstrate that the proposed evaluation method can comprehensively and intuitively reflect the risk distribution and trend.
Key words : privacy protection;de-identified datasets;re-identification risk assessment;information entropy

0 引言

    在大數據時代下,數據共享、發布和交易等場景需求變得越來越多,一方面促進了數據流通與價值利用,另一方面引發的個人數據與隱私安全事件近年來呈現爆發趨勢[1]

    為了應對挑戰,在法規層面,全球掀起了數據隱私的立法熱潮,如歐盟《通用數據保護條例》(GDPR)、美國《加州消費者隱私法案》(CCPA)等。我國2017年實施的《網絡安全法》,其中一個章節專門明確個人信息安全;此外,我國《個人信息保護法》在加快立法與制定中。在技術層面,如何平衡數據利用與隱私保護問題,已經成為學術界和工業界的一大研究熱點[2]。當前,已經發展出了保留格式加密(Format-Preserving Encryption,FPE)[3]、差分隱私(Differential Privacy,DP)[4]、K-匿名(K-Anonymity)[5]和L-多樣性(L-Diversity)[6]以及去標識化(De-identification)[7]等技術。其中,去標識化技術通過對原始個人信息進行部分屏蔽、泛化和失真等數據變換操作,是一種意圖消除“個人身份”的隱私保護技術。由于其處理規則簡單靈活且易于并行處理(高效),目前在隱私保護的數據發布和數據挖掘等實際場景中有廣泛應用與部署。通常,在工業界習慣稱為“數據脫敏”。




本文詳細內容請下載:http://www.tom3567.com/resource/share/2000003069




作者信息:

陳  磊1,2,薛見新1,2,張潤滋1,2,劉文懋1

(1.綠盟科技集團股份有限公司,北京100089;2.清華大學 自動化系,北京100084)

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 亚洲国产欧美一区二区三区不卡| 欧美精品v日韩精品v国产精品| 欧美专区国产专区| 国产伦精品一区二区三区视频免费| 欧美不卡视频一区发布| 欧美日韩国产不卡在线看| 欧美在线亚洲在线| 狠狠色综合欧美激情| 日韩在线精品一区| 欧洲精品亚洲精品| 97成人精品视频在线观看| 午夜精品99久久免费| 91禁国产网站| 91久久精品国产91久久| 欧美欧美一区二区| 久久精品国产电影| 欧美最猛性xxxxx(亚洲精品)| 久久6免费高清热精品| 欧美激情亚洲精品| 韩国成人一区| 久久精品亚洲精品| 久久人人97超碰精品888| 亚洲成人午夜在线| 欧美亚洲精品日韩| 日本三日本三级少妇三级66| 日本精品中文字幕| www.精品av.com| www国产亚洲精品久久网站| 欧美日韩国产免费一区二区三区| www高清在线视频日韩欧美| 久久99精品国产一区二区三区 | 国产在线精品自拍| 亚洲一区三区在线观看| 91精品视频免费看| 日韩在线免费视频观看| 色综合五月天导航| 一区不卡视频| 欧美中文在线观看国产| 国产日韩欧美日韩| 国产伦理久久久| 国产精品久久久久久久午夜|