什么是 差分隐私(Differential Privacy)?

差分隐私(Differential Privacy)是一种数学框架,用于限制加入、删除或替换一个已声明隐私单位后,随机化机制任意输出概率能够发生的变化。

快速了解

规范文档官方规范

工作原理

先定义邻接关系与隐私单位

先确定相邻数据集相差一个事件、一行、一个用户、一个家庭还是其他实体。User-Level Privacy 必须限制同一用户的全部贡献;Event-Level Privacy 可能暴露重复贡献者。NIST SP 800-226把隐私单位、隐私参数、算法、效用、偏差、信任模型、安全与采集实践共同视为可评估保证的一部分。

按敏感度校准机制

对于数值查询,Sensitivity 是相邻数据集之间允许出现的最大输出变化。Laplace Mechanism 通常按 sensitivity / epsilon 校准噪声;Gaussian Mechanism 在声明的 Accountant 下通常提供近似 (epsilon, delta) DP。Mean、Sum、Gradient 与 Histogram 都要先做裁剪或贡献限制,才能得到有限敏感度。Post-processing 不增加隐私损失,但重新查询源数据会产生新的发布。

管理组合与实现风险

针对重叠隐私单位的每次发布都会消耗隐私损失。应跨 Dashboard、实验、模型轮次和重试维护同一 Ledger,而不是让每个 Endpoint 重置 epsilon。DP-SGD 还要说明 Accountant 与 Sampling 假设。上线前测试安全随机数、浮点行为、Side Channel、边界、空群体和小切片,并用置信区间检查效用与差异化影响,因为噪声可能让小群体承担更高误差。

主要特点

  • 通过相邻数据集的输出分布定义隐私
  • 要求明确隐私单位与邻接关系
  • 使用 epsilon 以及近似 DP 中的 delta 量化隐私损失
  • 按有界敏感度或裁剪后的贡献校准随机性
  • 支持后处理不变性和多次发布的形式化组合
  • 需要权衡隐私、任务效用、偏差与运营成本

常见用途

  1. 从敏感人群数据发布计数或直方图
  2. 使用梯度裁剪与加噪的 DP-SGD 训练模型
  3. 在中心、本地或分布式信任模型下采集遥测
  4. 使用明确隐私预算生成合成统计数据
  5. 通过统一隐私账本审计重复分析发布

示例

loading...
Loading code...

常见问题

差分隐私中的 epsilon 和 delta 分别表示什么?

Epsilon 限制相邻数据集上输出概率的乘性变化,数值越小通常代表边界越强;delta 允许少量不受该乘性边界覆盖的加性失败概率。只有隐私单位、邻接规则、机制、Accountant 和发布范围相同,参数才可以直接比较。

给数据加入随机噪声就算差分隐私吗?

不算。机制必须基于已证明的 Sensitivity 或 Contribution Bound 校准随机性,并严格采用声明的邻接关系。实现还需要安全随机数、正确记账、Side Channel 控制和原始输入保护。任意扰动可能只降低准确度,却不提供有效 DP 保证。

什么是差分隐私预算?

隐私预算是针对明确人群与范围允许累积的隐私损失。重复分析通常会组合,因此每次发布都会消耗预算。生产 Ledger 应把支出绑定到数据集版本、隐私单位、机制、参数、任务和输出,不能让每个请求重新获得一份 epsilon。

差分隐私能阻止所有数据泄露吗?

不能。DP 在其假设下限制发布结果对一个受保护贡献的泄露,但不会加密原始数据、修复错误鉴权、阻止内部人员复制输入、保证算法公平,也不会让不合理的数据采集目的变得正当。这些风险必须由独立控制处理。

怎样评估差分隐私部署是否可信?

需要审查隐私单位、邻接关系、epsilon、delta、贡献边界、机制、信任模型、Accountant、发布次数、随机数与 Side Channel,再在关键切片上用不确定性区间评测效用,并验证实现是否符合声明算法。只报告 epsilon 不能构成充分评估。

相关术语

相关文章