什么是 Agent Harness?

Agent Harness 是 AI Agent 周围的应用控制系统,负责组装上下文、约束模型提案、中介工具与权限、持久化状态与副作用、输出证据,并执行终止、恢复、评测与发布策略。

快速了解

规范文档官方规范

工作原理

Agent Harness 把模型驱动的 Loop 变成可运营应用。它是工程抽象,不是标准协议,也不要求采用单一产品、服务或固定层数。它覆盖模型决策周围的控制,但不表示电气线束、机械约束或硬件 Test Harness。

Harness、Agent、Runtime 与 Workflow Engine 职责不同。Agent 在允许边界内选择或提出任务动作;Runtime 创建、调度、恢复并终止 Run;Workflow Engine 可提供 Durable History、Queue、Timer 与 Retry;Harness 则定义并连接 Context、Tool、Identity、Policy、State、Effect、Approval、Observation、Evaluation 与 Release 的应用级契约。一个 Library 可以封装多个角色,但故障和审计时仍需区分责任。

生产 Release 应固定 Model / Provider Adapter、System Instruction / Prompt Digest、Context Builder、Retriever / Data Policy、Tool Catalog / Schema Digest、Runtime / State Schema、Authorization Policy、Approval Rule、Budget、Parser、Evaluator 与 Event Schema。这个 Release Manifest 让 Run 具备足够可复现性,可用于比较、路由、回滚或隔离;单个 Model Name 不是完整 Agent Version。

模型负责 Proposal,可信代码负责 Authorization 与 Execution。Tool Schema 只校验形状,不证明权限。Harness 解析 Actor / Tenant Identity,过滤 Context,校验 Resource Scope,应用当前 Policy,必要时取得绑定 Proposal 的 Approval,用 Least-privilege Credential 调用窄 Adapter,校验并限制 Result,并阻止 Retrieved / Tool-provided Instruction 扩大权限。

权威 Run State 应与 Model Context、Transcript、Long-term Memory 和 Audit Evidence 分开持久化。并发 Worker 使用 State Version 或 Compare-and-set。Checkpoint 标记可以从哪里恢复,但外部 Write 还需要 Stable Operation Key 与 Effect Journal。Dispatch 后 Timeout 可能是 outcome_unknown,重试前先向 Source System 对账。Cancellation 不会撤销已提交 Effect。

Message、Retrieved Document、Tool Definition、Tool Result、File、Web Page 与 Worker Output 都是不可信数据。应用 Allowlist、Provenance、Size / Type Limit、Redaction、Sandbox、Egress Control、Secret Isolation、Output Validation 与 Downstream Authorization。Approval Gate、Guardrails 与 Human-in-the-Loop 只能降低特定风险,不能让高权限 Adapter 自动安全。

Evidence Plane 应关联 Release、Run、Step、Call、Parent、Attempt、Model、Tool、Policy Decision、Approval、Operation Key、Effect Status、Usage、Cost、Latency、Redaction、Cancellation 与 Terminal Reason。不要保留隐藏思维链或不必要的敏感 Payload。使用完整 Trajectory 与 Source-system Outcome 对比更简单的确定性或 Single-agent Baseline,再通过 Shadow Run、有界 Canary、Rollback Criteria 与 Failure Injection 扩大自主性。

主要特点

  • 连接 Context、Model、Tool、Identity、Policy、State、Effect 与 Evidence 的应用级契约
  • 明确区分 Agent Decision、Runtime Execution、Workflow Durability 与 Harness Control
  • 使用版本化 Release Manifest,而不是把模型名称当作完整部署身份
  • 分离 Proposal、Authorization、Execution、Effect Accounting 与 Observation
  • 支持 Durable State、幂等副作用、未知结果对账、取消和恢复
  • 用 Trajectory Evaluation、Failure Injection、Shadow、Canary 与 Rollback Evidence 发布

常见用途

  1. 以租户隔离和审批绑定写操作运行客服 Agent
  2. 把 Coding Agent 限制在已审阅 Repo、Command、Network 与 Merge Path
  3. 以来源、预算、结果限制和引用校验运行 Research Agent
  4. 通过 Policy、Credential、Validation 与 Effect Record 中介 MCP / API Tool
  5. 针对新 Release 回放失败 Run,但不重复生产副作用
  6. 使用 Trajectory、已验收业务结果、延迟和成本比较 Agent Release

示例

loading...
Loading code...

常见问题

Agent Harness 与 AI Agent 是同一个概念吗?

不是。Agent 提出决策和动作;Harness 是周围的应用控制系统,约束输入、工具、权限、状态、副作用、证据、恢复与发布。

Agent Harness 与 Agent Runtime 有什么区别?

Runtime 负责 Run / Step 执行、调度、持久化与取消;Harness 范围更广,定义 Runtime 如何连接 Context、Policy、Tool、Approval、Effect、Evaluation、Security 与 Release Governance。

Agent Harness 必须使用某个框架吗?

不必。它可以由应用代码、Model / Tool Adapter、Workflow Engine、Policy Service、Store、Sandbox 与 Telemetry 组合而成。该术语不定义唯一标准架构或 Vendor。

Agent Harness 应记录哪些信息?

记录版本化 Release Identity、Run / Step Event、Model / Tool Call、Policy / Approval Decision、State Version、Operation Key、Effect Status、Error、Budget、Latency、Cost、Redaction、Cancellation 与 Terminal Outcome。

Agent Harness 能保证安全吗?

不能。它让选定边界可强制和测试;安全仍取决于 Narrow Capability、Least Privilege、Downstream Authorization、Isolation、Data Governance、Evaluation、Monitoring、Incident Response 与人工问责。

相关术语

相关文章