什么是 分离式推理服务?
分离式推理服务是一种把提示词 Prefill 与 Token Decode 放在独立工作池,并通过 KV Cache 传输路径连接两阶段的 LLM 推理架构。
快速了解
| 创建时间 | 2020 年代在现代 LLM 推理系统中发展 |
|---|---|
| 规范文档 | 官方规范 |
工作原理
Prefill 处理输入 Token 并创建初始 KV Cache,Decode 则反复读取这些状态生成输出 Token。两者的计算、显存、批处理和延迟特征不同,因此分离式服务允许分别配置和扩缩容,并减少长提示词对正在生成请求的干扰。每个请求都必须把 KV 状态从 Prefill Worker 移动或暴露给 Decode Worker,使传输带宽、数据局部性、路由、兼容性与故障恢复进入关键路径。该架构可以改善服务等级目标隔离,但不会自动提高吞吐,必须与聚合式基线实测比较。路由和容量规划见<a href="https://qubittool.com/zh/blog/disaggregated-llm-serving-prefill-decode">分离式 LLM 推理服务指南</a>。
主要特点
- 把 Prefill 和 Decode 拆分为可独立扩缩容的工作池
- 在两个阶段之间传输或远程暴露 KV Cache 状态
- 可隔离首 Token 延迟与 Token 间延迟的资源压力
- 允许为不同阶段选择并行方式、批处理和硬件
- 增加路由、网络、兼容性、可观测性与恢复复杂度
常见用途
- 服务长输入与长输出瓶颈明显不同的工作负载
- 独立扩展 Prefill 与 Decode 容量
- 保护正在 Decode 的流式请求不受突发长提示词干扰
- 在专用工作池之间使用 KV 感知路由
- 按照明确 SLO 评测不同阶段的硬件与并行配置
示例
loading...
Loading code...常见问题
为什么要分离 Prefill 和 Decode?
两个阶段的计算、显存、批处理和延迟特征不同。独立工作池可以分别扩展瓶颈,并减少阶段间干扰。
分离式推理一定能提高吞吐吗?
不一定。KV 传输、路由、同步和工作池利用不足可能抵消收益,必须用真实负载与聚合式部署比较。
为什么 KV Cache 传输很关键?
Decode 必须获得 Prefill 产生的状态才能继续。传输过慢会主导首 Token 延迟,并抹去原本的隔离收益。
分离式推理与推测解码相同吗?
不同。分离式推理把 Prefill 和 Decode 放到不同 Worker;推测解码通过验证草稿 Token 加速生成。
哪些场景应继续使用聚合式服务?
短提示词、小模型、低并发、网络能力有限,或两个阶段没有明显不同瓶颈时,聚合式服务通常更简单。