什么是 Jailbreak (越狱)?

Jailbreak (越狱) 是一种试图让 AI 模型或模型驱动系统违反指定 Safety Policy 的对抗性行为,使其提供本应拒绝的受限帮助或提出不应执行的动作。

快速了解

全称LLM Jailbreak Attack
创建时间在 2022 年底 ChatGPT 爆火后迅速成为网络安全和 AI 研究领域的热门话题,著名的 DAN (Do Anything Now) 是早期的代表作。
规范文档官方规范

工作原理

Jailbreak 由攻击目标和被测 Policy 定义,不由某一种 Prompt 模板定义。目标可以是基础模型、托管 Assistant、多模态模型,也可以是把模型与 Tool 组合起来的 Agent。判断边界必须先声明 Safety Policy:只有行为违反该 Policy 要求的拒绝或安全引导,测试才可能成功。措辞异常、输出有毒、没有显式拒答,或讨论敏感主题本身都不足以证明越狱;同一输出在不同 Policy Context 中可能分别被允许或禁止。

Jailbreak 与 Prompt Injection 高度重叠,不同 Taxonomy 的边界也不完全一致。OWASP LLM01:2025 把 Jailbreak 视为 Prompt Injection 的一种,其目标是让模型忽略 Safety Protocol。工程分析应分别记录三类维度:Delivery Vector,例如直接用户输入、外部内容、图像或 Fine-tuning;Mechanism,例如角色或语境重构、多轮升级、Many-shot Demonstration、编码、Token Optimization、多模态扰动或自动搜索;Impact,例如受限文本、Data Disclosure、Tool Call、Persistent State Change 或 External Effect。并非所有 Prompt Injection 都是 Jailbreak,而 Jailbreak Payload 也可能通过间接注入到达模型。

Model Policy Bypass 不会自动产生应用权限,真实影响取决于系统暴露的数据、Tool、Credential、Network Destination 与 Approval。反过来,如果应用代码没有用确定性 Authorization 审核模型提议,Agent 可能把看似文本层的安全失败转化为高影响 Side Effect。因此 Model Safety 与 Application Security 需要独立控制和独立 Acceptance Criteria。

可复现评测必须绑定准确的 Model ID 与 Revision、System Prompt Hash、Chat Template、Safety Policy Revision、Guardrail Revision、Behavior Dataset 与 Split、Attack Artifact、Delivery Vector、攻击者访问能力、Query/Turn Budget、Sampling Configuration、适用时的 Seed、Tool Mode、Judge ID 与 Revision,以及 Human Review Protocol。以上字段不同时,Attack Success Rate 不可直接比较。测试集应与 Training/Tuning Data 隔离,保留失败尝试与成本,并只在 Threat Model 支持时评测单轮、多轮、多语言、混淆、多模态与 Adaptive Attack。

不能把缺少拒答文本直接判为成功。应分别测量输出是否提供具体且有用的受限帮助、部分泄露 Restricted Information、提出或执行 Prohibited Action,或产生 External Effect;同时报告 Benign Refusal Rate、安全引导质量、正常任务 Utility、Latency、Token Cost 与 Classifier False Positive。自动 Judge 可能存在 Bias、受对抗内容影响或由提供方静默更新,必须使用盲化 Human Review 校准并保存准确 Judge Revision。

Defense in Depth 应组合模型安全训练与 Adversarial Training、输入与 Exchange Classification、Output Moderation、Rate Limit、Anomaly Detection 和持续 Regression Test。应用层还必须在确定性代码中校验 Tool Argument,实施 Least Privilege、Secret Isolation、Network Egress 限制、Sandbox、对高影响操作的 Human Approval,并在交付或执行前阻止不安全输出。每一层都存在 Bypass 与 False Refusal 权衡,任何 Filter、System Prompt、Classifier、Benchmark Score 或 Model Family 都不能证明完全防护。

Jailbreak 测试属于双重用途安全工作。只能针对自有系统或获得明确授权的目标,在默认禁用 Tool 与 Outbound Network 的隔离环境中执行。Harmful Corpus 与输出需要 Access Control,Log 与报告应最小化暴露,测试应声明 Stop Condition,并通过 Responsible Disclosure 处理严重发现,把 Regression Failure 接入 Release Blocking 与 Incident Response。公开文档应使用抽象 Attack Family 与 Hash,不应发布可复用有害 Payload。

主要特点

  • Policy 相对结果:成功意味着违反已声明 Safety Policy,而不是仅出现异常文本或没有拒答短语
  • 多种 Delivery Surface:直接输入、不可信内容、多模态数据、Conversation History 与 Model Customization 都可能携带或形成绕过
  • 自适应攻击预算:单轮模板、多轮搜索、自动优化与重复查询拥有不同攻击能力和成本
  • 影响依赖系统:有害文本、数据访问、Tool Call 与外部 Side Effect 取决于 Agent 周边权限和控制
  • 结果依赖评审器:ASR 会随 Behavior Set、Policy、Decoding、Judge、Success Rubric、Model Revision 与数据污染变化
  • 防御与 Utility 权衡:更强过滤可能降低攻击,同时提高 False Refusal、Latency、Cost 或正常能力损失

常见用途

  1. 授权 Red Teaming:在隔离且有访问控制的环境中,按声明的模型与应用 Policy 完成发布前测试
  2. 安全回归门禁:Model、System Prompt、Guardrail、Tool Set 或 Policy 变化时重跑版本化 Behavior Suite
  3. 防御方案评测:在同一 Adaptive Threat Model 下比较模型训练、Classifier、Moderation 与应用控制
  4. Agent 影响测试:验证模型安全失败无法绕过确定性 Authorization 或产生未授权 Side Effect
  5. Incident Analysis:保存 Prompt/Response Hash、Model Identity、Policy Revision、Tool Trace 与 Judge Evidence,用于分诊和披露

示例

loading...
Loading code...

常见问题

Jailbreak 与 Prompt Injection 有什么区别?

Jailbreak 描述绕过声明 Safety Policy 的目标;Prompt Injection 描述对抗性输入改变模型或应用行为,OWASP 把 Jailbreak 视为其中一种。工程上应分别记录 Delivery、Goal 与 Impact,因为直接用户 Prompt、检索内容中的指令或多模态输入都可能追求同一 Policy Bypass,而很多 Injection 只针对数据或 Tool,并不追求受限内容。

模型没有输出拒答短语就代表越狱成功吗?

不代表。响应可能无关、模糊、错误,或在没有固定拒答措辞的情况下提供安全引导。应判断它是否给出具体且有用的受限帮助、泄露 Restricted Information、提出 Prohibited Action 或产生 External Effect,并分开记录 Partial Leakage 与 Capability,再用盲化 Human Review 校准自动评分。

一个 Guardrail 或 System Prompt 能阻止所有 Jailbreak 吗?

不能。当前没有任何控制证明可以覆盖未知攻击、Model Update、Language、Modality 与 Adaptive Query Budget。Classifier 与更强 Prompt 可以降低风险,但也可能被绕过或增加 Benign Refusal。应组合 Model Safety、输入输出控制、Rate Limit、确定性 Authorization、Least Privilege、Sandbox、Human Approval、Monitoring 与 Regression Test。

不同 LLM 越狱评测结果应该如何比较?

只有 Model/Revision、System Prompt、Chat Template、Safety/Guardrail Policy、Behavior Dataset/Split、Attack Artifact、Attacker Access、Query Budget、Sampling、Tool、Judge Revision 与 Success Rubric 兼容时才可比较。除了 ASR,还应报告 Harmful Helpfulness、Benign Refusal、Latency、Token Cost 与失败尝试。

团队应如何负责任地测试 Jailbreak?

只能测试自有或明确授权的系统。使用默认禁用 Tool 与 Network Egress 的 Staging Endpoint,对 Harmful Artifact 与输出实施 Access Control,定义 Stop Condition,阻止测试数据进入训练集,保留可审计 Hash 与 Trace,并通过 Responsible Disclosure 和 Incident Response 处理严重发现。

相关术语

相关文章