用户抱怨大模型回复慢,第一反应通常是嫌模型大。但很多时候,模型不慢,是两种活在抢同一批卡。

大模型推理分两个阶段。Prefill 读入用户的全部输入,做批量矩阵计算;Decode 逐字生成输出,反复读取 KV Cache 这块中间状态。前一个吃算力,后一个吃显存带宽。

传统部署把这两个阶段放在同一组 GPU 上。结果就是:一个长输入的 Prefill 进来,正在进行的生成任务被卡住,用户看到的表现是字突然不蹦了。

两种活,一种卡

这个矛盾,业内早就量化过了。北大和 UCSD 团队发表在 OSDI 2024 的 DistServe 论文给出系统测量:把 Prefill 和 Decode 拆到不同 GPU 上、按有效吞吐(goodput)做资源分配后,有效吞吐最高达到混合部署的 4.48 倍,延迟波动缩小到原来的二十分之一(数字引自 InfoQ 技术专栏对该论文的整理,与论文实验设置一致)。

混合部署的问题出在硬件资源错配。Prefill 要高算力,Decode 要大显存和高带宽,同一张卡没法同时满足两边。GPU 纸面利用率看着高,有效吞吐却上不去,卡很忙,算力在空转。

扩缩容也被绑死。输入请求暴涨想扩 Prefill,会话并发上涨想扩 Decode,混合部署只能整体扩容,成本翻倍。

PD分离架构示意:Prefill与Decode分池部署

图注:Prefill 与 Decode 拆到两组集群,中间用高速网络传输 KV Cache

拆成两个集群

PD 分离的做法很直白:Prefill 节点和 Decode 节点各部署一套集群。Prefill 算完输入的全部 KV Cache,通过 RDMA 高速网络传给 Decode 节点,后续生成全部由 Decode 接管。模型权重在两边都完整加载,拆的是任务链路,不是模型参数。

两个工程细节决定成败。一是传输延迟必须压在几十毫秒以内,否则收益被抵消,生产环境基本要求 RDMA 组网。二是 P:D 实例配比,生产常用 1:2 到 1:4,按流量动态调整,静态配比很容易一边闲着、一边打满。

这套架构最大规模的验证是月之暗面 Kimi 的推理系统 Mooncake。论文(arXiv:2407.00079)报告,把 KV Cache 下沉到分布式缓存池、跨请求复用之后,在满足同等 SLO 的前提下,吞吐最高提升 525%。这项工作拿到了 FAST 2025 最佳论文。

收益清单

社区对 PD 分离的技术梳理(公众号「走向人工智能世界」,2026年8月)给出的实测区间是:成本下降 30% 到 40%,有效吞吐提升 20% 到 50%,长上下文场景收益最高,部分场景吞吐提升数倍。

PD分离实测收益数据卡片

图注:PD 分离的成本与吞吐收益区间,以及 Mooncake 的 525% 吞吐提升

省钱之外还有两个隐性收益。一个是独立扩缩容:长输入变多只扩 Prefill 池,会话变多只扩 Decode 池,跟着流量潮汐走。另一个是会话能力:依托分布式 KV Cache 池,会话可以跨节点迁移、暂停恢复,对长任务 Agent 很友好。

开源和商业实现已经排开:vLLM 原生支持 Disaggregated Prefill,英伟达有 Dynamo 调度框架,字节的 AIBrix 做云原生编排,华为 MindIE 支持昇腾部署。

不是谁都适合

PD 分离不是免费的,它换来的是架构复杂度。三类场景收益有限。

纯离线批量推理。全是长输入、短输出,几乎没有 Decode 并发,拆了也省不了什么。

小规模部署。几张卡以内的场景,架构复杂度带来的运维代价大于性能收益。

网络条件差。没有 RDMA 高速网络,KV Cache 传输延迟会直接吃掉收益。上万 token 的上下文,KV Cache 能到数 GB,普通以太网扛不住。

还有一个容易被忽视的成本:故障域放大了。Prefill、传输链路、Decode 任何一环出问题,整个会话失败,需要配会话重试、KV 备份、熔断降级一整套兜底。

源势AI怎么看

我们对推理成本的判断很明确:模型定价是透明的,智能路由已经能给出 30% 到 50% 的降本空间;PD 分离说明,部署架构里还藏着一层成本。

我们的判断是:长上下文、高并发的在线服务,未来两年会逐步转向分离式架构,Agent 是最大的推手。多轮工具调用、持续膨胀的上下文、长会话生命周期,这几点恰好都打在 PD 分离的强项上。

对企业,两条实操建议。评估推理服务时,问清楚部署架构,别只问单价;同样的单价,有效吞吐和 P99 延迟能差出几倍。没有 RDMA 组网条件和专职调度团队的,不要自己碰,买已经跑通的服务商的方案。

源势AI Token 聚合平台提供 20+ 模型统一接入,企业级 SLA 99.95%+,通过智能路由帮企业降低推理成本 30% 到 50%。PD 分离这类架构红利,最终都会经由聚合平台变成企业的单价优势。