什么是 后门攻击(Backdoor Attack)?
后门攻击(Backdoor Attack)是一类在机器学习模型中植入隐藏行为的对抗操纵:攻击者选定的 Trigger 会触发目标输出,而普通输入仍可能保持正常表现。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
明确触发器、目标和植入路径
BadNets 研究展示了模型在正常任务上保持表现、遇到指定图案却改变预测的现象。现代评测必须说明攻击者控制的是记录、标签、本地更新、训练代码、Adapter 还是权重,Trigger 属于固定、动态、语义还是物理形式,目标是类别、生成行为、安全绕过还是下游操作。
分别测试正常行为与触发行为
报告 Clean Utility、不同源类别上的 Attack Success Rate、Benign Input 的 False Activation、Trigger Prevalence、置信度、微调后的持续性,以及 Crop、Paraphrase、Noise 或上下文变化下的结果。攻击开发阶段应留出未见 Trigger Family 和 Source Class。总体准确率可能掩盖可靠后门,而一个成功 Trigger 也不能证明普遍可利用。
组合供应链控制与行为控制
固定 Model、Dataset、Adapter 与 Training Code 的 Digest,验证来源和签名,分离构建与审批身份,并保留可信 Evaluation Set。按威胁加入 Trigger Search、Activation 或 Representation Analysis、Targeted Fuzzing、Output Invariant 与 Canary Monitoring。Fine-tuning、Pruning、Filtering 或机器遗忘可能缓解已测试后门,但必须针对自适应 Trigger 和 Clean Utility 回归重新评测。
主要特点
- 产生由 Trigger 条件激活的攻击者指定行为
- 可在总体 Clean Performance 正常时长期休眠
- 可通过数据、更新、代码、Adapter 或模型权重植入
- 触发器可见、不可见、词法、语义、物理或上下文相关
- 必须联合评测 Clean Utility、Attack Success 与 False Activation
- 可能跨微调、迁移、压缩或部署转换持续存在
常见用途
- 审计第三方模型仓库提供的预训练模型与 Adapter
- 红队测试外包训练和微调流水线
- 检查联邦模型中的恶意 Client 触发行为
- 验证安全关键的视觉、语音与文本分类器
- 调查只在可重复条件下出现的狭窄生产故障
示例
Loading code...常见问题
后门攻击与数据投毒有什么区别?
数据投毒描述对训练数据的恶意控制,可造成整体降级、指定错误或后门;后门攻击描述隐藏的 Trigger 条件行为,也可能通过权重、代码、Adapter 或 Checkpoint 植入。两者有交集,但不能互作同义词。
为什么带后门的模型能通过常规验证?
攻击者会让模型在 Trigger 缺席时保持正常,因此干净验证集可能只采样到良性行为。检测需要 Trigger-aware 或行为导向测试、来源审查,并覆盖不同 Source Class 与输入变换。高 Clean Accuracy 是必要效用指标,不是没有后门的证据。
后门攻击评测应报告哪些指标?
应报告 Clean Utility、符合条件的 Triggered Input 上的 Attack Success Rate、Benign Input 的误触发、目标与源类别、Trigger 可见性和出现率、置信度、模型变更后的持续性,以及不同随机种子的统计。防御结论还应覆盖未见 Trigger 变体和 Adaptive Attack。
微调或剪枝能删除后门吗?
有时可以,但都不是通用保证。后门可能与正常行为共享参数,跨迁移学习保留,或针对 Detector 自适应。每次修复后都要重新测 Clean Utility 与 Attack Success,覆盖变形和未见 Trigger,并保留回滚;来源或残余风险不可接受时应拒绝该产物。
Prompt Injection 属于模型后门吗?
通常不属于。Prompt Injection 在推理时提供恶意指令或检索内容,可影响一个未被修改的模型;模型后门在使用前已经植入,等待 Trigger。攻击者可以组合两者,但二者的信任边界、检测证据与缓解措施不同。