什么是 机器遗忘(Machine Unlearning)?

机器遗忘(Machine Unlearning)是更新已训练机器学习系统的过程,目标是按声明标准移除或限制指定 Forget Set 的影响,同时保留模型在 Retained Data 上的有效行为。

快速了解

规范文档官方规范

工作原理

定义遗忘合同与参考模型

机器遗忘奠基研究把遗忘描述为:对受支持算法,比完整重训更高效地移除训练记录及其 Lineage。工程合同应声明 Forget Unit 与 Dataset Version、Retained Data、训练随机性、覆盖的 Artifact、可接受等价标准、截止时间和攻击者。对随机训练,Exactness 可能表示匹配重训分布,而不是得到逐位相同权重。

区分精确、近似与行为压制

Exact Sufficient-statistic Update、选定 Shard 重训、Influence Approximation、Gradient-based Update、Distillation、Model Editing 与 Output Filter 的主张不同。Refusal Layer 或 RAG 删除可压制访问,却不改变模型权重。Approximate Unlearning 必须说明距离或隐私标准与失败概率;只在 Record Deletion 上验证的方法不能改称 Concept 或 Capability Removal。

联合评测遗忘、保留、隐私与重学

可行时构建 Retrained Model,对比 Forget Set、Retain Set、独立测试集、相关概念和受保护人群上的行为。报告 Utility、Calibration、Distributional Distance、Membership 或 Extraction Probe、Adversarial Prompting、Relearning Speed、计算与不确定性。NeurIPS Machine Unlearning Challenge强调标准化比较,但有限指标集合无法证明所有痕迹和未来攻击都已消除。

主要特点

  • 以声明的 Forget Set、Retained Data 与训练系统 Lineage 为起点
  • 可行时以完整重训作为最强实践参照
  • 包含保证不同的 Exact 与 Approximate Method
  • 必须区分记录、用户、类别、特征、概念和能力移除
  • 在遗忘效果、保留效用与连带损害之间权衡
  • 验证不能只依赖 Output Refusal 或一次 Membership Test

常见用途

  1. 在可重训 ML 流水线中响应已验证的数据删除请求
  2. 移除已发现的投毒或错误标注训练记录
  3. 从模型 Lineage 中撤销已授权数据集
  4. 在同意、政策或所有权变化后修复模型
  5. 在明确边界下研究狭窄概念或危险能力移除

示例

loading...
Loading code...

常见问题

删除训练记录就等于机器遗忘吗?

不等于。删除源记录会阻止部分后续使用,但它的影响可能仍在模型参数、Feature、Checkpoint、Adapter、Distilled Model、Cache 与下游 Artifact 中。遗忘流程要定义覆盖哪些 Lineage,执行更新或重建,并针对声明的参考与 Threat Model 验证结果。

精确遗忘与近似遗忘有什么区别?

Exact Unlearning 满足不含 Forget Set 的训练等价标准;训练含随机性时,这个标准可能作用于结果分布。Approximate Unlearning 接受量化或经验验证的偏差来节省时间与算力。方法必须说明标准,仅让模型在遗忘样本上 Accuracy 降低不构成精确保证。

机器遗忘能证明删除法规合规吗?

不能。法律义务取决于司法辖区、角色、目的、例外、合同、身份核验,以及所有持有原始数据或派生物的系统。机器遗忘可以支持删除计划的一部分,但仍需源数据删除、Lineage 传播、Backup 处理、访问控制、操作记录和法律评审。

团队怎样验证模型已经忘记?

可行时与移除 Forget Set 后重训的模型比较,再测试 Forget-set Behavior、Retained Utility、相关概念、Privacy Attack、Adversarial Prompt、Relearning 与多个随机种子;记录不确定性和覆盖的 Artifact。通过一次 Membership Test 或拒答一个 Prompt 只证明该测试结果。

机器遗忘能删除投毒样本或后门吗?

当有害记录及其 Lineage 已知,且方法支持对应训练过程时,它可以发挥作用。但后门也可能位于权重、代码、Adapter 或未知记录中,近似修复还可能保留残余行为。信任修复模型前,要重新执行 Trigger Test、Clean Utility、来源审查和 Adaptive Attack。

相关术语

相关文章