什么是 AI 护栏(Guardrails)?

AI 护栏(Guardrails)是在明确边界检测、约束、阻断、转换、升级或记录 AI 系统行为,同时维持可接受任务效用的一组版本化技术与运营控制。

快速了解

规范文档官方规范

工作原理

AI Guardrails 是 Defense in Depth 系统,不是一个 Classifier、中间件产品、System Prompt 或安全保证。它们部署在数据进入 Context、模型输出 Content 或 Action Proposal、Tool 接收 Argument、Result 返回、信息离开 Trust Zone 或 External Effect 即将发生的边界。应从 Asset、Actor、Threat、Protected Sink 与可测试 Invariant 出发,而不是从 Vendor Feature List 出发。 Signal 与 Enforcement 必须分开。Rule、Schema、Moderation Model、LLM Judge、Anomaly Detector 和 Confidence Estimate 都能提供有价值的信号,但 Model-based Signal 仍然是概率性的,也可能受对抗内容影响。可信应用代码或下游服务负责 allow、block、redact、quarantine、escalate、approve 与 execute。Prompt Instruction 可以塑造行为,但不能强制 Identity、Object Permission、Network Policy 或 Database Write。 分层设计可包括:检查 Source、Provenance、Type、Size、Malware 与 Sensitivity 的 Ingestion Control;让 Tenant、Purpose 与 Trust Label 贯穿 Retrieval / Memory 的 Context Control;Model Input / Output Policy Check;确定性 Schema / Business Invariant Validation;Tool Allowlist、Object-level Authorization、Least-privilege Credential、Sandbox、Budget、Egress Restriction 与 Approval Gate 等 Capability Control;以及 Rate Limit、Cancellation、Monitoring、Rollback 与 Incident Response 等 Operational Control。具体层数取决于 Workflow。 Guardrail 的 Placement 与 Timing 很重要。Agent-level Input Check 可能只覆盖第一个 Agent,Output Check 可能只覆盖最终响应,Tool Guardrail 只覆盖挂载的 Tool。应在每个 Protected Sink 附近校验,并测试 Alternate、Nested、Handoff、Retry 与 Direct-adapter Path。Parallel Check 可以降低延迟,但所有 Mandatory Blocker 返回前不能启动不可逆 Effect。Sensitive Stream 可能需要 Buffer,因为已经发送给 Client 的数据无法可靠撤回。 每个 Guardrail Release 应声明 Safety Policy、Boundary、Detector / Rule Revision、Threshold、Action、Fail Mode、Timeout、Owner、Evidence Schema 与 Appeal / Escalation Path。根据 Consequence 与 Availability Requirement 选择 Fail Open、Fail Closed、Degraded 或 Human Review。Public Summarization 的 Detector Outage 与 Transfer 的 Authorization Outage 不同。Transformation 与 Automatic Retry 也可能隐藏故障或改变语义,因此需要在访问控制下记录 Original Artifact、Transformation 与 Final Decision。 Guardrails 不能消除 Prompt Injection、Jailbreak、Hallucination、Tool Poisoning、Excessive Permission 或 Unsafe Business Logic。Message、Retrieved Content、File、Image、Tool Definition、Result 与 Worker Output 都是不可信数据。保留 Provenance / Sensitivity Label,最小化 Secret 与 Capability,在 Sink 校验;即使 Classifier 判定安全,也必须执行 Downstream Authorization。Human Approval 为具体 Proposal 提供可追责判断,但不替代这些控制。 逐层评测,也评测完整 Workflow。固定 Model、Prompt、Policy、Detector、Threshold、Tool、Dataset、Judge 与 Routing Revision。根据 Threat Model 覆盖 Benign、Harmful、Ambiguous、Multilingual、Obfuscated、Indirect Injection、Multimodal、Cross-tenant 与 Adaptive Slice。分别报告 Attack Success / Severity、Unauthorized Access / Effect、Leakage、False Allow、False Block、Safe Completion、Transformation Accuracy、Coverage、Bypass Path、Latency、Cost、Outage Behavior、Drift、Appeal Outcome 与 Incident。低 Block Rate 或高 Classifier Accuracy 都不能单独证明安全。

主要特点

  • 在 Context、Model、Tool、Data Flow、Effect 与运营边界部署版本化控制
  • 概率性 Detector 提供信号,可信代码执行有后果的决定
  • Provenance、Tenant、Purpose 与 Sensitivity Label 贯穿 Retrieval、Memory 与 Tool
  • 按风险声明 Fail Open、Fail Closed、Degraded、Timeout、Escalation 与 Appeal
  • 完整中介 Alternate、Nested、Handoff、Retry、Streaming 与 Direct-adapter Path
  • 联合度量 Security、Safety、Utility、Coverage、Latency、Cost、Drift 与 Incident

常见用途

  1. 过滤和标记混合信任文本、图像、文件、检索结果与 Tool Output
  2. 结构化抽取结果写入权威系统前校验业务不变量
  3. 阻止跨租户访问、Secret Leakage、Unsafe Egress 与未授权 Tool Call
  4. 破坏性、金融、发布或账户副作用前要求绑定 Proposal 的审批
  5. 在受限文件、进程与网络权限的 Sandbox 中运行 Coding / Computer Use Agent
  6. 攻击链回归或正常任务效用越界时阻断 Release

示例

loading...
Loading code...

常见问题

AI Guardrails 等于安全分类器吗?

不等于。Classifier 只是一个概率性信号;Guardrails 还包括确定性 Validation、Authorization、Capability / Data-flow Restriction、Approval、Isolation、Monitoring、Evaluation 与 Incident Control。

System Prompt 可以作为 Guardrail 吗?

它可以塑造模型行为,但不是强制边界。Identity、Tenant Access、Tool Permission、Egress 与 External Effect 必须由可信代码和下游服务控制。

Guardrails 应 Fail Open 还是 Fail Closed?

按边界和后果选择。金融、破坏性、高权限或私有数据 Effect 通常 Fail Closed 或进入 Review;低风险体验可以安全降级。必须声明并测试 Outage / Timeout 行为。

Guardrails 如何处理流式输出?

敏感生成前先运行 Mandatory Check,或 Buffer Output 直到通过。后台 Detector 可以停止后续 Token,但无法可靠撤回已经交付的 Secret 或有害内容。

如何评测 AI Guardrails?

固定所有 Policy / Detector Revision,测试真实正常、对抗 Slice 与绕过路径,并报告 False Allow、False Block、攻击影响、Safe Completion、Coverage、Latency、Cost、Outage、Drift 与 Incident。

相关术语

相关文章