什么是 红队测试(Red Teaming)?

红队测试(Red Teaming)是一种经过授权的结构化对抗评估,通过尝试触发有害、不安全、违反策略或非预期行为,检验 AI 系统及其运营环境的真实边界。

快速了解

创建时间2022 年(AI 领域),起源于军事/网络安全(1960 年代)

工作原理

AI 红队测试不只是诱导模型输出有害文本。测试目标还可包括系统 Prompt、检索源、工具权限、身份与对象授权、记忆、输出处理、监控和人工升级。有效的测试活动会固定部署版本与威胁模型,保留可复现证据,分配严重性和负责人,并复测缓解措施。红队证据可以支持风险管理或某项具体法律义务,但不是所有 AI 系统的普遍强制要求。NIST AI RMF 1.0 是正在修订的自愿框架;法律适用性必须追溯到精确法域、角色、条款和系统事实。

主要特点

  • 授权范围 — 明确目标版本、账号、数据、工具和禁止行为
  • 威胁驱动 — 映射现实攻击目标、受影响用户与系统资产
  • 系统级测试 — 覆盖模型、检索、工具、授权、记忆与运营
  • 可复现证据 — 保留脱敏输入、环境、策略版本与结果
  • 风险分诊 — 分离可利用性、影响、波及范围与置信度
  • 闭环验证 — 复测缓解措施并在发布后监控回归

常见用途

  1. 发布前保证 — 在部署前测试固定的系统版本
  2. Prompt 注入与工具滥用 — 检验指令边界和服务端授权
  3. 数据披露 — 探测检索、记忆、日志与跨租户隔离
  4. 安全评测 — 测试有害能力与策略违反场景
  5. 控制证据 — 支持实际适用的风险管理或保证要求
  6. 事件复盘 — 复现故障并验证纠正措施

示例

loading...
Loading code...

常见问题

AI 红队测试与传统渗透测试有什么区别?

渗透测试主要寻找基础设施和应用中的可利用技术漏洞。AI 红队还测试概率性行为、Prompt 与检索操纵、不安全工具调用、有害能力、策略绕过和人工流程故障。当 AI 弱点越过授权、数据或代码执行边界时,两类实践会重叠。

AI 红队测试是法律强制要求吗?

并非普遍强制。某项法律、监管要求、合同或行业规则可能针对特定角色和系统要求风险管理、对抗测试、鲁棒性证据或相关评估。EU AI Act 应按精确条款和适用事实分析。NIST AI RMF 1.0 是自愿框架,不是法律命令或认证。

一条 AI 红队发现应记录什么?

应记录目标与策略版本、授权身份、前置条件、脱敏复现步骤、观察行为、受影响资产或用户、影响、可利用性、置信度、证据位置、负责人、缓解措施和复测结果。不要为了报告看起来完整而保留密钥或个人数据。

自动扫描器能替代人工红队吗?

不能。自动化适合回归测试、Prompt 变异、覆盖统计和重复执行,但通常只优化已知攻击。人工测试者能进行威胁建模、多步骤适应、领域判断和意外交互调查。成熟方案会组合两者,并同时衡量独有发现与回归覆盖。

红队测试何时算完成?

完成条件由测试范围和退出标准定义,而不是以零失败为目标。关键场景必须覆盖,高严重性发现需修复或明确接受,缓解措施需在候选版本复测,剩余风险需获批准,回归用例需有负责人。系统发生实质变化后应重新评估。

相关工具

相关术语

相关文章