什么是 Agent 轨迹(Agent Trajectory)?
Agent 轨迹(Agent Trajectory)是一次 AI Agent Run 中可观察 Decision、Message、Tool Proposal、Policy Outcome、Execution、Observation、State Transition、Approval、Error、Cost 与 Terminal Outcome 的结构化因果记录。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
Agent Trajectory 回答一次 Run 中系统观察到什么、实际做了什么。它比只包含用户可见 Message 的 Chat Transcript 更广,又比包含 Storage、Network、Queue 与 Infrastructure Span 的完整 Distributed Trace 更窄。Trajectory 可以从 Trace 和 Runtime Event 派生,但应采用稳定的任务级 Schema,而不是绑定某家 Vendor 的 Telemetry Layout。
Trajectory 不等于隐藏思维链。应记录可观察 Model Output、结构化 Action Proposal、Policy Decision、Tool Version、脱敏 Argument Digest、Execution / Effect Status、有界 Observation、State Transition、Approval、Usage、Latency、Error 与 Terminal Reason;不要求也不保留 Private Reasoning Token。运行后生成的自然语言 Summary 是 Annotation,不是权威 Event。
每个 Event 需要稳定 run_id、step_id、Event Type、Schema Version、Release Identity、Timestamp 与 Parent / Causal Link。Parallel Branch 构成 Partial Order,只按 Wall-clock Timestamp 排序会虚构不存在的顺序。保留 Call ID、Operation Key、Attempt Number,以及必要的 Worker / Provider Identity,并区分 proposed、authorized、dispatched、committed、failed、cancelled 与 outcome_unknown。
只为声明的 Purpose 收集最少数据。在 Export 前脱敏,分离 Content 与 Metadata,在只需比较相等性时 Hash 敏感 Argument,按 Tenant / Role 控制访问,加密存储 Payload,并定义 Retention、Deletion 与 Sampling Decision。Tool Result 和 Retrieved Content 可能含 Prompt Injection、Secret、Personal Data 或版权内容;Telemetry Storage 不是信任边界。
Trajectory Replay 有多种含义。Static Replay 把已记录 Observation 输入新 Orchestration / Policy Code,不调用依赖;Mock Replay 模拟 Tool;Live Replay 调用当前 Model / Tool,具有非确定性、成本和副作用风险。没有 Sandbox、Idempotency 与显式审批时禁止 Live Replay Write。固定 Model、Prompt、Tool Schema、Policy、Dataset 与 Evaluator Version,比较才可解释。
评测分为 Single-step Correctness、Trajectory Quality 与 Final Environment Outcome。确定性检查可以强制 Required-before-write 顺序、Forbidden Tool、Argument Constraint、Budget / Approval Rule,或比较 Strict、Unordered、Subset 与 Superset Tool-call Pattern。Rubric / Model Judge 可评价 Adaptation 与 Efficiency,但需要 Calibration、Blind Sample、Disagreement Handling,并为安全规则保留 Deterministic Veto。最终答案正确不能抵消越权、重复或浪费路径。
主要特点
- 任务级因果事件记录,不等于聊天记录、原始日志或完整分布式 Trace
- 覆盖可观察 Proposal、Policy、Call、Effect、Observation、Approval、Error 与 Outcome
- 稳定关联 Run、Step、Parent、Call、Operation、Attempt、Schema 与 Release ID
- 用 Partial Order 表达并行工作,不虚构全局线性顺序
- Purpose-bound Collection、Export 前脱敏、租户权限、Retention 与 Deletion
- 结合 Single-step、Path 与 Final Outcome 的确定性和校准 Judge 评测
常见用途
- 定位失败 Run 中第一个错误、无用、拒绝或不安全步骤
- 检查高影响 Write 前是否完成授权与证据步骤
- 跨 Release 比较 Strict、Unordered、Subset 或 Superset Tool-call Path
- 从已审阅生产故障构建不保留 Secret 的 Regression Dataset
- 把 Latency、Token、Tool Cost、Retry 与 Cancellation 归因到因果步骤
- 在 Sandbox 中用已记录 Observation 回放新 Orchestration 或 Policy Code
示例
Loading code...常见问题
Agent Trajectory 与 Trace 或 Transcript 有什么区别?
Transcript 包含可见 Message;Distributed Trace 包含跨服务技术 Span;Trajectory 是从 Runtime Event 与 Trace 中选取的任务级行为记录,用于调试、评测、审计和 Outcome 分析。
Agent Trajectory 应包含思维链吗?
不应。记录可观察 Output、Action Proposal、Policy Decision、Tool Call、Result、Effect 与 Outcome 即可。隐藏推理对多数评测并非必需,还会增加隐私、安全与保留风险。
并行 Agent 步骤可以存成一个有序列表吗?
可以序列化存储,但评测必须保留 Parent 与 Causal Link。仅按时间排序可能误述 Concurrent Branch、Retry 与 Join。
Trajectory 可以安全回放吗?
使用已记录 Observation 的 Static Replay 最安全。Live Replay 非确定且可能重复外部 Effect,因此需要 Sandbox、固定版本、Idempotency,并为高影响操作取得显式审批。
应该如何评测 Agent Trajectory?
结合确定性 Policy / Path Check、Single-step Evaluator、Trajectory Comparison 或校准后的 Rubric Judge,并验证源系统最终 Outcome;不能只评最终答案。