医疗可信数据空间知识文档

从隐私计算到联邦协作的医疗数据基础设施

本文档解释 MedTrust 涉及的核心技术:联邦学习 FATE、多方安全计算、可信执行环境、 联盟链、医疗数据标准和常见联邦学习框架。整体目标是在医疗数据不离开机构边界的前提下, 支持多中心科研、模型训练、审计监管和可信结算。

系统架构图

MedTrust 采用联邦可信数据空间架构:数据提供方部署本地连接器,控制平面只负责身份、目录、 合约和任务编排。统一任务记录通过 workloadType 描述“做什么”,通过 method 描述“怎么执行”,使结构化 RWS 与多模态 SecretFlow 任务共用治理层、分走不同运行时。

医院 A
EHR / LIS / PACS
医院 B
FHIR / DICOM / OMOP
科研机构
队列与研究数据
本地接入
Connector
脱敏 / 策略执行 / 输出门控
隐私计算引擎
FATE / MPC / TEE / Flower
本地域数据仓
原始数据不离开机构边界
任务编排
MedTrust 控制平面
身份 / 目录 / 合约 / 任务
联盟链审计
哈希存证 / 状态追踪 / 结算
数据使用方
聚合结果 / 模型 / 报告
原始医疗数据留在本地只流通模型更新、密文份额或聚合结果授权与审计摘要上链

数据提供方

医院、科研机构、药企或区域平台保留原始病历、影像、检验和随访数据。

本地连接器

完成脱敏、策略执行、TEE/MPC/FL 任务运行和输出门控,确保数据不出域。

控制平面

管理参与方身份、数据产品目录、数字合约、任务编排和权限审核。

链上审计

保存合约哈希、授权记录、证明摘要、任务状态和结算凭证。

数据使用方

获得聚合结果、模型参数、研究报告或合规证明,而非原始患者级数据。

通用任务模型

workloadType 是平台级工作负载类型,method 是执行通道。二者分离后,控制面可以统一管理身份、 目录、合约、审计和结算,数据面按 workloadType 分发到 RWS、联邦学习或 SecretFlow 运行时。

legacy
既有计算任务
method: mpc / fl / tee / sandbox

兼容历史 ComputeTask 与已有演示,不改变原有 method 语义。

rws
真实世界研究
method: tee

面向结构化 FHIR/RWS 数据,走本地 connector、PEP、TEE 和输出闸门。

federated_learning
联邦学习训练
method: fl

承接 Flower/FATE 等横向或纵向联邦学习任务,输出模型更新或指标。

secretflow
多模态密态训练
method: mpc / tee

MVP 已接入:API 校验 secretflowSpec,connector 经 mock 适配器产出安全聚合结果;原始 DICOM/VCF/文本不离开本地。

SecretFlow 工作负载(MVP)

SecretFlow 面向多模态密态训练:DICOM 影像、基因组 VCF、临床文本与结构化 EHR 可在各参与方本地保留, 控制面只编排任务与合约,connector 按 workloadType 路由到 SecretFlow 运行时。创建任务时设置 workloadType: secretflow,并在 algorithmParams 中提交 secretflowSpec;method 必须为 tee mpc,表示密态执行通道。

与 RWS / 联邦学习的区别

  • RWS:结构化 FHIR 队列统计,单 method=tee,输出聚合统计。
  • 联邦学习:Flower/FATE 模型更新,method=fl。
  • SecretFlow:多模态 + LoRA 微调规格,method=tee|mpc,输出受 outputPolicy 约束的安全制品。

MVP 限制

  • 当前使用 mock 适配器,不调用真实 SecretFlow 集群。
  • 输出闸门会拒绝含 patientId、rawPayload 等敏感键的结果信封。
  • 前端暂无 SecretFlow 任务创建表单;通过 API 提交 secretflowSpec。

允许的安全输出(outputPolicy.allowedArtifacts)

  • lora_delta_hash — LoRA 权重更新的哈希摘要
  • encrypted_delta_ref — 加密模型增量的外部引用
  • aggregate_metrics — 聚合训练指标(loss、accuracy 等)
  • attestation_report — TEE/MPC 执行证明
  • model_card — 模型卡片元数据(不含原始样本)

演进路线

当前 MVP已实现

共享任务规格、API 校验、connector 路由、mock 适配器与安全输出闸门。

CLI / Python 适配器规划中

对接 SecretFlow 官方运行时,替换 mock 适配器,保留相同输出契约。

TEEU / HEU 适配器规划中

在 TEE 或同态加密单元中执行多模态 LoRA 微调,产出 attestation 与加密 delta 引用。

关键技术说明

这些技术并非相互替代,而是按数据类型、计算复杂度、性能要求和监管约束组合使用。

联邦学习 FATE

Federated AI Technology Enabler

FATE 是微众银行开源的工业级联邦学习平台,支持横向联邦、纵向联邦、联邦迁移学习、隐私求交、联邦特征工程和安全聚合。它适合多机构之间联合建模,但不交换原始样本。

  • 横向联邦适合多家医院拥有相似字段但患者不同的场景,例如多中心疾病预测。
  • 纵向联邦适合机构之间样本有交集但特征不同的场景,例如医院诊疗数据与药企随访数据联合分析。
  • 通过 PSI、同态加密、安全聚合等机制降低样本标识和模型更新泄露风险。

多方安全计算

Secure Multi-Party Computation

多方安全计算让多个参与方在不公开各自输入的前提下共同完成计算。每个参与方只看到自己的输入和最终允许披露的输出,中间值通常以秘密分享、混淆电路或同态加密形式存在。

  • 适合隐私统计、交集计算、风险评分、跨院指标汇总等结构化计算任务。
  • 安全性强,但通信轮次、协议选择和数据规模会显著影响性能。
  • 医疗场景中常与输出门控结合,避免小样本统计结果反推出个人信息。

可信执行环境

Trusted Execution Environment

TEE 是 CPU 或硬件平台提供的隔离执行区域,代码和数据在受保护的 enclave 中处理,宿主操作系统也不能直接读取。远程证明用于让数据提供方确认运行的是预期代码。

  • 适合需要运行复杂模型、医学影像分析、真实世界研究算法的场景。
  • 关键能力包括内存隔离、度量启动、远程证明和密钥封装。
  • 仍需防范侧信道、依赖供应链和输出泄露,不能替代数据治理策略。

联盟链

Consortium Blockchain

联盟链由许可节点共同维护账本,适合医疗数据流通中的多方审计、合约状态、模型哈希、计算结果摘要和授权记录存证。它强调可追溯与不可篡改,而不是存放原始医疗数据。

  • 链上记录合约、授权、任务、证明、结果摘要和审计事件。
  • 链下保存数据、模型和报告,链上只保存哈希与状态引用。
  • 智能合约可自动约束用途、期限、参与方和结算规则。

医疗数据标准

医疗数据协作的前提是语义一致。标准化能降低跨院字段差异、编码差异和系统接口差异, 让隐私计算任务有稳定的数据输入。

HL7 FHIR

临床资源交换

用 Patient、Observation、Condition、Medication、Encounter 等资源统一跨系统接口。

DICOM

医学影像

承载 CT、MRI、超声等影像及元数据,适合影像 AI 和多中心影像研究。

ICD-10/ICD-11

疾病诊断编码

统一诊断分类,支持病例筛选、队列定义、医保和公共卫生统计。

LOINC

检验检查编码

标准化实验室指标和测量项目,减少不同医院检验名称差异。

SNOMED CT

临床术语体系

表达更细粒度的临床概念,支持语义检索、知识图谱和临床决策支持。

OMOP CDM

真实世界研究模型

把多源医疗数据映射到统一研究数据模型,便于队列研究和药物安全分析。

联邦学习框架对比

框架选择取决于项目阶段。生产级跨机构协作通常关注安全协议、调度、审计和运维; 算法研究则更关注模型接口、实验速度和可扩展性。

框架
定位
优势
适用场景
FATE
工业级联邦学习平台
横向、纵向、迁移学习能力完整,内置 PSI 与安全协议
金融、医疗多机构联合建模
Flower
轻量联邦学习框架
易接入 PyTorch、TensorFlow、JAX,适合快速实验和边缘设备
科研原型、移动端、跨框架训练
FedML
端云协同联邦学习
覆盖训练、部署、调度和实验管理
IoT、移动端、云边端协同
TensorFlow Federated
联邦算法研究
与 TensorFlow 生态结合紧密,适合模拟和算法验证
学术研究、算法原型
PySyft
隐私计算与数据治理
强调远程数据访问控制、隐私预算和数据科学工作流
隐私保护数据科学、数据访问审批

建设医疗可信数据空间的核心原则

先做身份可信、授权可信、执行可信和结果可信,再谈数据流通规模。联邦学习、MPC、TEE 与联盟链 共同解决的是不同层面的信任问题:谁能参与、能算什么、在哪里算、结果如何证明、责任如何追踪。

  • 数据最小化:只取任务需要的字段和样本范围。
  • 计算本地化:原始数据在连接器和本地域内处理。
  • 输出可控:小样本、明细行和敏感结果必须被阻断。
  • 全程留痕:合约、证明、结果摘要和结算凭证可审计。