什么是 分离式推理服务?

分离式推理服务是一种把提示词 Prefill 与 Token Decode 放在独立工作池,并通过 KV Cache 传输路径连接两阶段的 LLM 推理架构。

快速了解

创建时间2020 年代在现代 LLM 推理系统中发展
规范文档官方规范

工作原理

Prefill 处理输入 Token 并创建初始 KV Cache,Decode 则反复读取这些状态生成输出 Token。两者的计算、显存、批处理和延迟特征不同,因此分离式服务允许分别配置和扩缩容,并减少长提示词对正在生成请求的干扰。每个请求都必须把 KV 状态从 Prefill Worker 移动或暴露给 Decode Worker,使传输带宽、数据局部性、路由、兼容性与故障恢复进入关键路径。该架构可以改善服务等级目标隔离,但不会自动提高吞吐,必须与聚合式基线实测比较。路由和容量规划见<a href="https://qubittool.com/zh/blog/disaggregated-llm-serving-prefill-decode">分离式 LLM 推理服务指南</a>。

主要特点

  • 把 Prefill 和 Decode 拆分为可独立扩缩容的工作池
  • 在两个阶段之间传输或远程暴露 KV Cache 状态
  • 可隔离首 Token 延迟与 Token 间延迟的资源压力
  • 允许为不同阶段选择并行方式、批处理和硬件
  • 增加路由、网络、兼容性、可观测性与恢复复杂度

常见用途

  1. 服务长输入与长输出瓶颈明显不同的工作负载
  2. 独立扩展 Prefill 与 Decode 容量
  3. 保护正在 Decode 的流式请求不受突发长提示词干扰
  4. 在专用工作池之间使用 KV 感知路由
  5. 按照明确 SLO 评测不同阶段的硬件与并行配置

示例

loading...
Loading code...

常见问题

为什么要分离 Prefill 和 Decode?

两个阶段的计算、显存、批处理和延迟特征不同。独立工作池可以分别扩展瓶颈,并减少阶段间干扰。

分离式推理一定能提高吞吐吗?

不一定。KV 传输、路由、同步和工作池利用不足可能抵消收益,必须用真实负载与聚合式部署比较。

为什么 KV Cache 传输很关键?

Decode 必须获得 Prefill 产生的状态才能继续。传输过慢会主导首 Token 延迟,并抹去原本的隔离收益。

分离式推理与推测解码相同吗?

不同。分离式推理把 Prefill 和 Decode 放到不同 Worker;推测解码通过验证草稿 Token 加速生成。

哪些场景应继续使用聚合式服务?

短提示词、小模型、低并发、网络能力有限,或两个阶段没有明显不同瓶颈时,聚合式服务通常更简单。

相关工具

相关术语

相关文章