什么是 红队测试(Red Teaming)?
红队测试(Red Teaming)是一种经过授权的结构化对抗评估,通过尝试触发有害、不安全、违反策略或非预期行为,检验 AI 系统及其运营环境的真实边界。
快速了解
| 创建时间 | 2022 年(AI 领域),起源于军事/网络安全(1960 年代) |
|---|
工作原理
AI 红队测试不只是诱导模型输出有害文本。测试目标还可包括系统 Prompt、检索源、工具权限、身份与对象授权、记忆、输出处理、监控和人工升级。有效的测试活动会固定部署版本与威胁模型,保留可复现证据,分配严重性和负责人,并复测缓解措施。红队证据可以支持风险管理或某项具体法律义务,但不是所有 AI 系统的普遍强制要求。NIST AI RMF 1.0 是正在修订的自愿框架;法律适用性必须追溯到精确法域、角色、条款和系统事实。
主要特点
- 授权范围 — 明确目标版本、账号、数据、工具和禁止行为
- 威胁驱动 — 映射现实攻击目标、受影响用户与系统资产
- 系统级测试 — 覆盖模型、检索、工具、授权、记忆与运营
- 可复现证据 — 保留脱敏输入、环境、策略版本与结果
- 风险分诊 — 分离可利用性、影响、波及范围与置信度
- 闭环验证 — 复测缓解措施并在发布后监控回归
常见用途
- 发布前保证 — 在部署前测试固定的系统版本
- Prompt 注入与工具滥用 — 检验指令边界和服务端授权
- 数据披露 — 探测检索、记忆、日志与跨租户隔离
- 安全评测 — 测试有害能力与策略违反场景
- 控制证据 — 支持实际适用的风险管理或保证要求
- 事件复盘 — 复现故障并验证纠正措施
示例
Loading code...常见问题
AI 红队测试与传统渗透测试有什么区别?
渗透测试主要寻找基础设施和应用中的可利用技术漏洞。AI 红队还测试概率性行为、Prompt 与检索操纵、不安全工具调用、有害能力、策略绕过和人工流程故障。当 AI 弱点越过授权、数据或代码执行边界时,两类实践会重叠。
AI 红队测试是法律强制要求吗?
并非普遍强制。某项法律、监管要求、合同或行业规则可能针对特定角色和系统要求风险管理、对抗测试、鲁棒性证据或相关评估。EU AI Act 应按精确条款和适用事实分析。NIST AI RMF 1.0 是自愿框架,不是法律命令或认证。
一条 AI 红队发现应记录什么?
应记录目标与策略版本、授权身份、前置条件、脱敏复现步骤、观察行为、受影响资产或用户、影响、可利用性、置信度、证据位置、负责人、缓解措施和复测结果。不要为了报告看起来完整而保留密钥或个人数据。
自动扫描器能替代人工红队吗?
不能。自动化适合回归测试、Prompt 变异、覆盖统计和重复执行,但通常只优化已知攻击。人工测试者能进行威胁建模、多步骤适应、领域判断和意外交互调查。成熟方案会组合两者,并同时衡量独有发现与回归覆盖。
红队测试何时算完成?
完成条件由测试范围和退出标准定义,而不是以零失败为目标。关键场景必须覆盖,高严重性发现需修复或明确接受,缓解措施需在候选版本复测,剩余风险需获批准,回归用例需有负责人。系统发生实质变化后应重新评估。