联邦学习 FATE
Federated AI Technology Enabler
FATE 是微众银行开源的工业级联邦学习平台,支持横向联邦、纵向联邦、联邦迁移学习、隐私求交、联邦特征工程和安全聚合。它适合多机构之间联合建模,但不交换原始样本。
- 横向联邦适合多家医院拥有相似字段但患者不同的场景,例如多中心疾病预测。
- 纵向联邦适合机构之间样本有交集但特征不同的场景,例如医院诊疗数据与药企随访数据联合分析。
- 通过 PSI、同态加密、安全聚合等机制降低样本标识和模型更新泄露风险。
本文档解释 MedTrust 涉及的核心技术:联邦学习 FATE、多方安全计算、可信执行环境、 联盟链、医疗数据标准和常见联邦学习框架。整体目标是在医疗数据不离开机构边界的前提下, 支持多中心科研、模型训练、审计监管和可信结算。
MedTrust 采用联邦可信数据空间架构:数据提供方部署本地连接器,控制平面只负责身份、目录、 合约和任务编排。统一任务记录通过 workloadType 描述“做什么”,通过 method 描述“怎么执行”,使结构化 RWS 与多模态 SecretFlow 任务共用治理层、分走不同运行时。
医院、科研机构、药企或区域平台保留原始病历、影像、检验和随访数据。
完成脱敏、策略执行、TEE/MPC/FL 任务运行和输出门控,确保数据不出域。
管理参与方身份、数据产品目录、数字合约、任务编排和权限审核。
保存合约哈希、授权记录、证明摘要、任务状态和结算凭证。
获得聚合结果、模型参数、研究报告或合规证明,而非原始患者级数据。
workloadType 是平台级工作负载类型,method 是执行通道。二者分离后,控制面可以统一管理身份、 目录、合约、审计和结算,数据面按 workloadType 分发到 RWS、联邦学习或 SecretFlow 运行时。
兼容历史 ComputeTask 与已有演示,不改变原有 method 语义。
面向结构化 FHIR/RWS 数据,走本地 connector、PEP、TEE 和输出闸门。
承接 Flower/FATE 等横向或纵向联邦学习任务,输出模型更新或指标。
MVP 已接入:API 校验 secretflowSpec,connector 经 mock 适配器产出安全聚合结果;原始 DICOM/VCF/文本不离开本地。
SecretFlow 面向多模态密态训练:DICOM 影像、基因组 VCF、临床文本与结构化 EHR 可在各参与方本地保留, 控制面只编排任务与合约,connector 按 workloadType 路由到 SecretFlow 运行时。创建任务时设置 workloadType: secretflow,并在 algorithmParams 中提交 secretflowSpec;method 必须为 tee 或 mpc,表示密态执行通道。
共享任务规格、API 校验、connector 路由、mock 适配器与安全输出闸门。
对接 SecretFlow 官方运行时,替换 mock 适配器,保留相同输出契约。
在 TEE 或同态加密单元中执行多模态 LoRA 微调,产出 attestation 与加密 delta 引用。
这些技术并非相互替代,而是按数据类型、计算复杂度、性能要求和监管约束组合使用。
Federated AI Technology Enabler
FATE 是微众银行开源的工业级联邦学习平台,支持横向联邦、纵向联邦、联邦迁移学习、隐私求交、联邦特征工程和安全聚合。它适合多机构之间联合建模,但不交换原始样本。
Secure Multi-Party Computation
多方安全计算让多个参与方在不公开各自输入的前提下共同完成计算。每个参与方只看到自己的输入和最终允许披露的输出,中间值通常以秘密分享、混淆电路或同态加密形式存在。
Trusted Execution Environment
TEE 是 CPU 或硬件平台提供的隔离执行区域,代码和数据在受保护的 enclave 中处理,宿主操作系统也不能直接读取。远程证明用于让数据提供方确认运行的是预期代码。
Consortium Blockchain
联盟链由许可节点共同维护账本,适合医疗数据流通中的多方审计、合约状态、模型哈希、计算结果摘要和授权记录存证。它强调可追溯与不可篡改,而不是存放原始医疗数据。
医疗数据协作的前提是语义一致。标准化能降低跨院字段差异、编码差异和系统接口差异, 让隐私计算任务有稳定的数据输入。
用 Patient、Observation、Condition、Medication、Encounter 等资源统一跨系统接口。
承载 CT、MRI、超声等影像及元数据,适合影像 AI 和多中心影像研究。
统一诊断分类,支持病例筛选、队列定义、医保和公共卫生统计。
标准化实验室指标和测量项目,减少不同医院检验名称差异。
表达更细粒度的临床概念,支持语义检索、知识图谱和临床决策支持。
把多源医疗数据映射到统一研究数据模型,便于队列研究和药物安全分析。
框架选择取决于项目阶段。生产级跨机构协作通常关注安全协议、调度、审计和运维; 算法研究则更关注模型接口、实验速度和可扩展性。
先做身份可信、授权可信、执行可信和结果可信,再谈数据流通规模。联邦学习、MPC、TEE 与联盟链 共同解决的是不同层面的信任问题:谁能参与、能算什么、在哪里算、结果如何证明、责任如何追踪。