00 / 09
决策只看一件事:能否证明“匿名”

医疗健康数据
匿名化后数据要素交易技术可行性与合规放行路径

基于《健康医疗数据匿名化技术规范(试行)》与 700 条虚构模拟记录的 K-匿名方法验证

01 / 09

一句话结论

医疗数据可以出域交易,前提是同时拿到两张“通行证”:

① 技术证明匿名 + ② 流通全程可控

本次 700 条模拟数据验证:最小 K 值为 24;按“组织外部两方受控共享”取 S=1/5、E=1,匿名化程度 A=24×1/5×1=4.8≥1

展开专业口径:为什么不能只说“达到 K=24 就自动合规”
K 与 A 是效果评估证据,但正式匿名化结论还须完成:直接标识符消除、去标识化达到 3 级、对抗性测试、不能复原性核验、环境与管理保障评估,以及独立复核并出具评价报告。工作簿也明确写明:700 条数据为虚构模拟数据,只验证方法,不替代真实交易数据集的合规结论。

规范依据:3.2、4.4(a)、7.1-7.3、附录 A;数据依据:工作簿“K值计算”B6:B12、F5。

02 / 09

30 秒讲清概念

去标识 ≠ 匿名化

去标识化

  • 不借助额外信息时,无法识别
  • 额外信息仍可能把人找回来
  • 仍属于个人信息

匿名化

  • 无法识别特定自然人
  • 不能复原原始个人信息
  • 匿名数据不属于个人信息

去标识化做到极致,并经双重评估通过,才进入“匿名数据”状态。

规范原文口径:3.1 去标识化;3.2 匿名化及注 1、注 2;4.3 安全目标。

03 / 09

官方规范第 5 章

六步闭环:从原始数据到可流通数据

需求分析

定场景、对象、范围;明确风险与可用性目标

本次已形成方法样例

策略制订

识别直接标识符、准标识符、敏感属性;选模型和参数

8 项准标识符

匿名化处理

删除、不可逆假名化、泛化、扰动、聚合、组合处理

规则逐字段留痕

效果评估

无法识别 + 不能复原;K、A、攻击测试、评价报告

K=24,A=4.8

风险管理

合同、日志、审计、监测、再评估

作为放行条件

流通环境

身份、最小权限、隔离计算、输出管控、追溯

受控共享优先

任何一项不通过,就退回策略制订重新处理;不是“一次脱敏、永久放行”。

规范依据:5.1-5.7;评估回退机制见 5.5、7.3.2。

04 / 09

700 条模拟记录如何处理

该删的删 · 该粗的粗 · 该留的留

姓名 / 直接标识不可逆假名化:患者_0001
年龄区间化:20-30 岁
入院 / 出院 / 检查日期泛化至月:2026-01
入院 / 出院血压收缩压 / 舒张压区间
总胆固醇0.5 宽度区间
医疗机构地点泛化:某医院 / 某医疗机构
长文本去识别信息,保留诊断、症状、治疗等临床语义
规范推荐技术
逐字段可追溯对应 6.1 与表 1-3

数据依据:工作簿“结构化字段(700例)”第 12-13 列;规范依据:6.1.3、6.1.6-6.1.9、表 1-3。

05 / 09

K-匿名效果评估 / 核心数据页

700 条实测:最小 K = 24

700模拟患者记录
8纳入组合的准标识符
28等价类数量
24最小等价类规模 K
K=2410 类 / 240条
K=258 类 / 200条
K=2610 类 / 260条
A = K × S × E
= 24 × 1/5 × 1
= 4.8 ≥ 1

场景:组织外部两方、受控公开共享;环境系数暂取标准建议中间值 1。

每条记录至少与另外 23 条记录拥有相同的 8 项准标识符组合,不能单凭该组合唯一锁定某个人。

8 项组合:性别|年龄段|入院月份|出院月份|入院血压区间|检查月份|总胆固醇区间|出院血压区间

证据边界:这些是虚构模拟数据。K=24 不是全国统一的法定阈值,也不能单独证明“不能复原”;它证明的是方法与计算链路可行。真实交易数据须按实际场景重新计算 K、S、E,并完成完整评估。

规范依据:7.2(b)、附录 A.1-A.3;数据依据:工作簿“K值计算”B6:B12、G17:I20、F21:F23、C16:E23、C25:L724。

06 / 09

为什么可以出域交易

不是“放开原始数据”,是“放行匿名数据产品”

原始医疗数据
= 个人信息
按用途最小化
分类处理
无法识别
+ 不能复原
独立评价
结论通过
受控环境
全程留痕
匿名数据产品
进入交易链路
技术闸门

K、A、标识度、攻击测试、不能复原性证据、可用性评估。

治理闸门

场景审核、合同禁重识别、最小权限、日志审计、输出管控、应急处置。

规范依据:3.2、4.4(a)、7.3.2、8.1-8.2。这里的“可交易”是完整条件成立后的放行结论,不是仅凭 K 值自动出域。

07 / 09

风险可控 · 持续保障

出域不是失控:责任跟着数据走

合同禁止重识别

限定目的、范围、期限、二次提供条件;约定泄露通知与违约责任。

最小权限 + 强身份

角色/属性访问控制,多因子认证,租户隔离,敏感操作实时预警。

全链路日志可审计

记录调取、加工、模型训练、参数导出;日志抗篡改、行为可追溯。

输出前再次评估

离开安全可信环境前内置匿名化检查;不合格结果不允许输出。

定期重评估

用途、算法、参数、环境变化或发生疑似事件时,立即触发复验。

独立复核 + 备案

处理人与评价/批准人相互独立,形成可复现证据与正式评价报告。

领地公开共享数据不离开物理/虚拟领地
受控公开共享协议约束使用,优先试点
完全公开共享召回困难,要求更高 K 值

规范依据:3.13-3.15、5.6-5.7、7.3.2.3-7.3.2.4、8.1-8.2。

08 / 09

把共识变成可执行机制

请求局领导支持三项行动

认可“六步闭环 + 双闸放行”为萧山标准流程

统一卫健、数据、运营、使用各方的技术口径与责任边界。

启动“受控两方共享”的首批数据产品交易试点

只有取得完整匿名化评价结论的数据才进入交易链路;K≥24 作为本样例证据,不设为脱离场景的唯一门槛。

建立“匿名化效果评估备案”机制

一产品一场景一报告:参数、证据、责任人、有效期、复验触发条件全部可查。

先以一批数据产品跑通闭环,再复制到全区。 已具备:规范映射 · 字段规则 · K/A 计算 · 评估清单 · 备案框架
09 / 09

规范原文在线查阅

《健康医疗数据匿名化技术规范(试行)》

↗ 新窗口打开 PDF