什么是 工作流编排(Workflow Orchestration)?
工作流编排(Workflow Orchestration)是在一个有界业务流程中,对任务、依赖、状态、Timer、Signal、Policy、Approval、外部副作用与 Terminal Outcome 进行结构化协调的执行方式,该流程可以包含模型或 Agent。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
工作流编排把模型与 Agent 调用视为更大业务流程中的 Activity。Workflow 负责 Process Identity、Input / Output Contract、State Transition、Dependency、Schedule、Approval、Retry Class、Cancellation 与 Terminal Status。LLM 可以分类、抽取、生成或选择有界 Route,但不能替代 Orchestrator 或 Source System 的授权。
Chain 是有序步骤组合,Graph 表达显式 Branch、Cycle、Join 与 State;Workflow Orchestration 则负责让这些结构跨越 Worker Failure、长期等待、Deployment 与 External Event 可靠运行。Agentic Workflow 把选定的运行时决策委托给 Agent;对于可重复或受监管流程,确定性 Workflow 仍更合适。
Durable Execution 通常把可 Replay 的 Orchestration 与 Model Call、Network Request、Clock、Random Value 和 Write 等非确定性 Activity 分开。Runtime 可能从 Event History 重建 State 或从 Checkpoint 恢复,因此 Workflow Code 与版本变更必须保持 Replay Compatibility。Replay 可以复用已完成 Activity Result,但在故障边界附近 Activity 仍可能被重复派发;外部 Write 必须使用稳定 Idempotency Key、Effect Status 与下游对账。
Retry Policy 应按 Failure Class 定义,而不是全局统一。Transient Provider / Network Failure 使用带 Backoff、Jitter 与 Deadline 的重试;Validation / Policy Failure 进入修复、拒绝或 Review。派发后 Timeout 可能是 outcome_unknown,不能直接标记失败或盲目重复。若需抵消之前已提交 Action,应使用显式 Compensation 或 Saga;Compensation 是新的可失败动作,不是时间回退或数据库回滚。
Human Approval 与 External Callback 应作为 Durable Signal,关联一个 Workflow Run 和精确 Proposed Operation。持久化 Actor、Approver、Resource、Argument / Schema Digest、Policy Version、Decision 与 Expiry,并在执行前再次校验。等待不能依赖存活的 Web Request 或 Worker Process。
对 Workflow Definition、State Schema、Activity、Prompt、Model、Policy 与 Payload Contract 统一版本化。用新代码 Replay 旧 History / Checkpoint,为 In-flight Run 定义 Migration 或 Drain 策略,并限制 Event History 与 State 增长。Observability 应记录 Workflow / Run ID、Step Attempt、Decision、Wait、Effect、Cost 与 Terminal Reason,但不记录隐藏思维链或不必要私密数据。
评测既要验证 Control-flow Correctness,也要验证 Business Outcome。覆盖 Duplicate Event、Out-of-order Signal、Stale Approval、Worker Crash、Provider Timeout、Cancellation、Concurrent Update、Schema Migration、Replay Divergence、Compensation Failure 与 Poison Payload。Durable Execution 提高恢复可靠性,但不能证明模型决策、Tool Result 或业务动作正确。
主要特点
- 有界流程身份、契约、依赖、状态、Signal、Timer 与 Terminal Outcome
- 可 Replay 的 Orchestration 与非确定性模型、工具、网络和 Write Activity 分离
- 按错误分类定义 Retry、Timeout、Cancellation、幂等、未知结果与补偿
- Durable Human Approval 与 Callback 关联精确 Workflow Operation
- 统一版本化 Definition、State Schema、Activity、Prompt、Model、Policy 与 Migration
- 记录 Attempt、Wait、Decision、Effect、Cost、Recovery 与最终 Outcome
常见用途
- 文档摄取、抽取、校验、人工复核、索引和发布
- 定时运行 Prompt、Model、Retrieval 与安全评测 Pipeline
- 跨 Worker Restart 和审批等待的长期 Agent Task
- 具有幂等 Write 与显式 Compensation Step 的业务流程
- 带并发限制、Fan-out、Join、Retry 和可追踪输出的批量 AI Job
- 模型决策受确定性 Policy Gate 限制的监管流程
示例
Loading code...常见问题
Workflow Orchestration 与 Agentic Workflow 有什么区别?
Workflow Orchestration 是更广的流程执行方法,可以完全确定。Agentic Workflow 把部分运行时决策委托给 Agent,但 Orchestrator 仍强制执行 State、Policy、Budget、Effect 与 Terminal Outcome。
Durable Execution 能保证副作用 Exactly-once 吗?
不能。Runtime 可以 Replay Orchestration 并持久化已完成 Activity Result,但故障边界附近的 Activity 仍可能被再次派发。外部 Write 仍需 Idempotency Key、Effect Record 与下游对账。
Retry 与 Compensation 有什么区别?
Retry 是在归类为瞬时错误后再次尝试同一操作;Compensation 是执行另一个业务动作来抵消之前已提交的 Effect。Compensation 也可能失败,必须可观测且幂等。
Workflow 升级时如何处理正在运行的实例?
发布前用新代码 Replay 旧 History。通过 Version Marker、兼容 Activity、State Migration、Worker Version Routing 或 Drain 保持确定性,不能假设新代码天然兼容所有旧 State。
Workflow Orchestration 能让 AI 输出变可靠吗?
它改善执行可靠性,不保证语义正确。模型输出仍需 Schema Validation、Evidence Check、Policy Gate、对抗评测、必要的人工 Review 与权威系统验证。