← 返回概念辨析

Concept Contrast Fable

数据隐私与 PII 遮蔽和匿名化

一个像在脸上戴面具——身份还在,只是暂时遮住了关键特征。一个像换了一张脸——原始身份从数据里被彻底剥离。把面具当整容,合规风险会在审计时一次性爆发。

寓言

面具和整容

城西有一家健康档案馆。馆长签了一份外借条款,里面写着两件事:给临时审阅者看的册子要遮住身份,放进长期研究库的册子要再也追不回个人。馆长以为把姓名、户籍号和住址涂黑就够了。

半年后,审计官来了。短期展示册看起来没问题:姓名遮住了,户籍号也遮住了。可研究库里的册子让审计官皱了眉。他把涂黑后的册页和街坊簿放在一起:某年某月出生、住在南门附近、职业是夜班护士、曾在同一周两次取药。几条线一合,街坊很容易猜出是谁。

馆长这才明白,遮住直呼其名的字段,只是给人戴面具。面具后面的身形、脚步、熟人关系还在,遇到别的册子一拼,仍可能露出原人。

要放进长期研究库,就不能只戴面具。档案员开始把年龄改成区间,把街坊改成片区,把罕见病种合并到大类,有些细节只留统计数,不再保留可回到个人的路径。

两条流程从此分开:临时展示追求可用和可控,仍要留在受管环境;长期研究追求难以回指,宁可牺牲一些细节。馆长辩解说,名字已经看不见了。审计官摇头,让他把册子分成两类:临时审阅只需要遮脸,长期入库则要拆掉能把人重新拼回来的线索。

他们重做了研究库:日期变成区间,住址只留城区,罕见职业合并成大类,取药记录也去掉能连回个人的细节。短期册子则保留更多业务信息,但只给授权者限时查看。

馆长这才分清,面具适合短暂办事,整容适合长期外借。前者让别人暂时看不见身份,后者要让身份难以被重新认出。

馆长后来给新人打比方:遮蔽是把名字盖住,匿名化是让那一行资料不再像某个具体的人。前者还能在严管下使用,后者才适合更远、更久地流动。

数据隐私与 PII 遮蔽

通过替换、加密或部分隐藏直接标识符(姓名、身份证号、电话号码等)来保护隐私。原始数据仍然存在,只是在外观上被遮盖,在受控环境下仍可恢复。重识别风险依然存在。

匿名化

对数据进行不可逆处理,使个人身份无法通过合理手段被重建。常用方法包括泛化、聚合、扰动和差分隐私。处理后的数据在法律上通常不再被视为个人信息。

故事对应

  • 星号替换姓名和电话:PII 遮蔽——遮盖直接标识符。
  • 出生日期 + 性别 + 邮政编码锁定个人:遮蔽的脆弱性,间接标识符组合可以重识别。
  • 面具:遮蔽——可以摘、可以被拼回来、原始脸还在后面。
  • 整容(泛化、聚合、扰动):匿名化——不可逆、无法重新定位到个人。
  • 两条处理链路分开管理:遮蔽和匿名化的工程实现、合规标准和适用场景完全不同。

落到项目里

在数据处理的早期设计阶段就明确每条数据管道的隐私等级。需要短期展示或日志脱敏的场景用遮蔽,但要标记为不可离开受控环境。需要长期存储、对外发布、跨组织共享的数据必须走匿名化管道,并做重识别风险测试。最容易踩的坑是把遮蔽过的数据当做匿名化数据传给下游——这在 GDPR 等法规下可能被认定为未充分匿名化。