截至 2026 年 7 月 19 日: 模型价格和服务条款变化快于常青文章。本文把成本视为特定工作负载的测量结果,而不是永久供应商排名。做迁移或路由决策前,应固定模型、地域、日期、合同、质量目标和流量形状。
核心要点
- 没有模型快照、日期、地区和 Token 构成的价目表,不足以支撑可靠预算。
- API 与私有运行时的经济性取决于利用率和运营范围,不存在通用 Token 盈亏线。
- 缓存、路由、压缩、批处理和小模型都应经过质量与安全门禁实验。
- 成本可观测性必须把供应商用量与应用事件、重试、人工复核、存储和基础设施对账。
- 应优化“每个已验收结果的成本”,而不是“每个生成 Token 的成本”。
建立带日期的成本账本
为每个供应商或运行时记录:
| 字段 | 示例 |
|---|---|
| 身份 | 供应商、模型 ID/权重、修订版、Endpoint、地区 |
| 计量 | 输入、输出、推理、缓存、批处理、图片/音频单位 |
| 条件 | 上下文或分辨率、质量档位、限流、并发 |
| 商务条款 | 生效日期、货币、税费、额度、合同折扣 |
| 可靠性 | 重试、失败任务、超时行为、重复副作用 |
| 证据 | 价目表 URL、账单条目、用量导出、访问日期 |
不要把公开标价和私有合同混在一起,也不要在不展示输入输出权重的情况下合并成一个“平均单价”。供应商更换模型 ID、Tokenizer、缓存政策或计费规则后,应重新生成账本。
先定义价值单位
Token 成本只是输入。可以使用如下业务单位:
cost_per_accepted_outcome =
(供应商 + 运行时 + 重试 + 复核 + 运营 + 基础设施)
/ 已验收结果数
“已验收结果”需要确定性规则或人工可验证标准。对 Agent,还要计入失败工具调用、重复动作、人工修正和未确定结果;对内容生成,应统计可用资产而不是尝试次数。
API 与私有运行时
两种方案必须放在同一服务契约下比较:
| 维度 | 托管 API | 私有或本地运行时 |
|---|---|---|
| 变动费用 | 按供应商计量 | 算力、能耗、存储、网络 |
| 固定费用 | 低用量时通常较低 | 工程、SRE、安全、支持 |
| 弹性 | 受供应商容量和配额影响 | 自己规划容量和扩缩容 |
| 变更成本 | 供应商模型和合同变化 | 权重、Kernel、运行时和硬件变化 |
| 数据边界 | 供应商条款和地区 | 自身控制、供应商、备份和操作人员 |
| 质量风险 | API/模型漂移 | 自行评测和升级负担 |
盈亏平衡点应由敏感性模型计算。改变流量、利用率、可批处理程度、延迟目标、副本数量、GPU 价格、人员分摊和验收率,观察结论如何变化。在读者无法复现假设前,不应发布固定阈值。
降本实验
路由与小模型
只有在分类器和回退逻辑可测量时才路由:
请求
-> 识别工作负载与风险
-> 选择已验证模型或确定性路径
-> 执行预算、授权和超时
-> 验收结果
-> 按明确原因升级或重试
按任务切片比较质量、工具调用有效性、拒答、恢复、延迟、成本和升级率。小模型便宜,不代表可以直接替代大模型。
缓存
分别评估精确缓存和语义缓存。有效缓存键可能包含租户、授权范围、策略版本、模型修订、地区、来源修订和新鲜度窗口。语义相似不能绕过权限检查,也不能返回过期的私有数据。
Prompt 压缩与上下文选择
压缩输入可能损伤指令、引用或安全约束。应使用 A/B Fixture 测量回答质量、证据覆盖、拒答行为、输入 Token、延迟和复核率。不能把其他数据集的压缩比或质量损失直接搬过来。
批处理
批处理可能降低单位价格,却增加排队延迟、存储、重试和取消复杂度。应记录供应商当前批处理条款,并测量完成时间分布,不要承诺固定时长。
可观测性与对账
将供应商用量与一个应用事件关联:
event_id
request_id
tenant_id_hash
model_revision
input_units
output_units
cached_units
retry_count
review_required
accepted_outcome
provider_cost
infrastructure_cost
根据保留目的脱敏 Prompt、密钥、个人数据和生成内容。保留足以对账和调查失败的元数据即可。Trace 是核算和调试证据,不代表可以永久保留每条原始模型消息。
可复现的预算模型
monthly_cost =
Σ(input_units × input_rate)
+ Σ(output_units × output_rate)
+ cache_and_batch_charges
+ retries_and_failed_work
+ storage_and_egress
+ moderation_and_human_review
+ observability_and_support
+ infrastructure_and_hardware_amortization
至少报告基准、低位和高位场景,改变输入输出比例、需求、缓存命中率、重试率、验收率、利用率、汇率和硬件价格。表格或 Notebook 应把假设与结果一起输出,换模型或价目表时无需重写结论。
决策门禁
- 基线:对账一段有代表性的时期,并按工作负载归类成本。
- 实验:一次只改变一个杠杆,同时测量质量、安全、延迟和成本。
- 发布:设置预算和验收门槛,指定负责人和回滚路径。
- 复核:模型、价格、策略、流量或数据变化时触发重新评测。
总结
推理经济学同时是核算和评测问题。单价下降并不保证总支出下降,因为流量、重试和已验收结果可能同时变化;私有运行时能增加控制力,也可能增加运营风险。保持账本带日期,在代表性工作负载上验证每项优化,把目标放在已验证结果的成本,而不是醒目的 Token 单价。