什么是 监督智能体(Supervisor Agent)?
监督智能体(Supervisor Agent)是多 Agent 系统中的集中式控制循环角色,负责维护共享任务状态、向专业 Agent 委派有边界的工作、评估返回证据,并决定继续、重试、升级还是终止。
工作原理
监督智能体是一种架构角色,不是标准化协议,也不要求所有控制决策都由 LLM 完成。常见实现让一个由 LLM 驱动的 Manager 保持用户会话与全局任务状态,把专业 Agent 暴露为 Tool;混合实现则让模型处理开放式拆解,同时由确定性代码执行预算、权限、状态转换和发布动作。
它不同于通常只分类并转发一次、不会持续拥有多步 Run 的 Router Agent,也不同于把当前控制权移交给专业 Agent 的 Handoff。只有当执行路径依赖中间结果,并且专业化、上下文隔离或并行工作产生可测价值时,才应引入 Supervisor。路径固定时应使用确定性 Workflow,简单任务则优先保留单 Agent。
每个 Worker 都需要版本化 Capability 描述、最小权限 Tool 集、输入输出 Schema、Context Policy、Timeout、Retry 语义和明确失败结果。Supervisor 必须记录 Task ID、依赖、State Revision、证据、尝试次数、Token/Tool Budget、Deadline、Checkpoint、完成标准和终止原因。
Worker 输出是不可信输入:更新共享状态前必须校验;外部副作用必须通过 Prompt 之外的 Idempotency Key、Authorization Check、Approval Gate 和持久记录保护。常见失败包括错误委派、重复工作、状态陈旧或丢失、Worker 静默失败、Retry Storm、过早结束、无限循环、Context 压缩丢失和汇总瓶颈。
评测应覆盖完整 Trace 与最终环境状态,并与单 Agent 或确定性 Baseline 比较,不能假设 Agent 越多越可靠。
主要特点
- 集中状态所有权:保持 Run Objective、Task Graph、依赖、已接受证据、尝试次数和终态一致
- 契约化委派:根据版本化 Capability 选择 Worker,并发送带明确输出与错误 Schema 的有界输入
- 自适应控制循环:可顺序或并行委派、检查结果、追问澄清、重试、重规划、升级或停止
- 有界执行:采用由工作负载确定的 Step、Token、Tool Call、Concurrency、Deadline、Retry 与 Recursion 限制
- 外部安全边界:在模型生成决策之外执行最小权限、幂等、鉴权、审批和持久状态控制
- 可追踪评测:记录每次委派与状态转换,用于端状态、Trajectory、成本、延迟和故障注入测试
常见用途
- 协调相互独立的研究路径,并按来源 Provenance 汇总证据
- 管理跨领域客服任务,同时保留每个 Worker 的数据与 Tool 权限
- 把软件分析、实现、测试和审查委派为可独立审计的任务
- 执行下一步取决于前一个专业结果的自适应调查流程
- 将高影响或有歧义的动作升级给人工,并保留可恢复 Checkpoint
示例
Loading code...常见问题
Supervisor Agent 与 Router、Planner、Handoff 有什么区别?
Router 通常对输入分类并完成一次分发;Planner 生成任务计划,但不一定执行或拥有状态;Handoff 把当前控制权转交给专业 Agent。Supervisor 则持续负责整个多步 Run:重复委派、接收结果、更新共享状态、决定下一步,并生成或批准终态。
Supervisor Agent 必须由 LLM 实现吗?
不必须。这个角色可以由 LLM、确定性代码或两者混合实现。真正开放的任务拆解与汇总可以使用模型;可预测路由、Budget、Schema 校验、Authorization、Idempotency 和不可逆动作 Gate 应放在代码中。固定流程不会因为所有边都由 LLM 决定而自动变得更好。
什么时候应使用 Supervisor,而不是单 Agent 或确定性 Workflow?
当执行路径无法预先确定、专业 Agent 需要实质不同的上下文或权限,并且中间结果会决定后续步骤时,可使用 Supervisor。如果有限 Tool 集可放入一个 Context,应优先单 Agent;如果顺序和条件已知,应使用确定性 Workflow。上线前应比较任务成功率、风险、延迟、Token 消耗和运维成本。
如何防止死循环、重复工作和重复副作用?
为每个任务设置稳定 ID 与状态,并限制 Step、Retry、Concurrency、Token、Tool Call 和总时长,同时要求明确终止原因。在高成本阶段前保存 Checkpoint,分别校验 Worker 状态与内容,并为外部写操作添加 Idempotency Key。重试可以重复读取,但不能静默重复付款、发消息、部署或删除。
如何评测 Supervisor Agent?
应测试委派准确率、任务完成、证据覆盖、重复或遗漏工作、Retry 与 Escalation 正确性、Budget 合规、尾延迟、成本和终止行为。通过故障注入模拟 Worker Timeout、错误 Schema、陈旧状态、冲突和 Tool 不可用,并评测最终环境状态与完整 Trace。LLM Judge 需要对人工标签校准,还应与更简单的 Baseline 比较。