发展趋势量子位5/10

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

By 思邈

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!
图源:量子位

AI 摘要

最新完整技术报告出炉

原文正文

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

最新完整技术报告出炉

允中 发自 凹非寺

量子位 | 公众号 QbitAI

在刚刚落幕的2026 WAIC世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构PDD。

现在,完整技术报告来了。

技术报告地址:https://github.com/infinigence/pdd

该架构以高性价比的广域网以太网串联多地已建成的同构数据中心,并将传统的PD分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构。

在让“偏科”的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下KV Cache的传输延迟痛点。

实测数据显示,该架构在实现了首Token延迟降低51.5%的同时,单Token成本可降低37.5%。

这不仅意味着用户端速度体验得到了显著提升,更实现了全域异构算力的最大化调度,让分散各处的存量集群资源能够充分释放产业价值。

今天,无问芯穹推理团队将首次分享这一架构的设计推演全貌,深度还原技术创新背后的思考路径与攻坚细节。

跨集群异构推理的理想与现实

过去的一年里,大模型推理的成本和效率,成为了整个行业共同面对的“生死线”。

行业共识在于:LLM的推理存在Prefill(预填充,计算密集型)和Decode(解码,访存密集型)两个特性迥异的阶段。

理论上的最理想的解法是“异构分离”路线:让算力强的卡负责Prefill,让显存带宽高的卡负责Decode。

但现实是骨感的。

要在同一个集群里构建大规模异构算力资源,不仅采购成本极其高昂,且一旦模型架构变了,这些固定配比的硬件就会很容易出现部分闲置的情况。

于是,一个很自然的想法冒了出来:

为什么不把分布在各地的、已经建好的同构集群,用低成本的广域网以太网连起来,做跨集群的异构分离式推理呢?

这一想法看似水到渠成,但一旦将其落到具体工程实践中,便立刻撞上了一堵“叹息之墙”——KV Cache的跨集群传输带宽和延迟瓶颈。

PDD架构也正是为了攻克这一难题而设计的。

但在深入这一架构的设计与实现细节之前,想先与大家分享无问芯穹团队在前期研究中发现的几个极其关键的“底层规律”,它们也是整个跨集群PD方案能够成立的核心前提。

痛点与洞察:硬件“偏科”与流量的“二八定律”

要理解PDD的设计,得从无问芯穹在PDD技术报告中Background部分揭示的三个核心Insights入手。

洞察1:硬件性能的“极度偏科”

LLM推理的Prefill与Decode两个阶段对硬件资源的需求是南辕北辙的,无问芯穹团队在内部基准测试中也发现,芯片的性能是极度“偏科”的:

以8卡的某旗舰高性能GPU为基线,某厂商的E芯片在处理计算密集的Prefill阶段时,只能达到基线约81%的性能;但在访存密集的Decode阶段,它却能爆发出基线210%的性能。

如果把这类“偏科”芯片放在同构集群里,既要扛Prefill计算又要做Decode输出,非但自身的长板优势无从发挥,反而会拖慢Prefill阶段的整体效率。

这一发现强烈激发了无问芯穹团队将Prefill与Decode拆分解耦、分别部署在最适合它们的硬件上这一想法。

洞察2:DRC技术带来的10倍“带宽”

仅仅考虑计算和访存还不够,跨集群传输庞大的KV Cache会瞬间吃掉广域网的带宽。

但好在Agent业务有个显著的特征:前缀缓存命中率极高。

利用这一特性,团队在Decode端部署了前缀缓存RadixCache(简称DRC)。

简单来说,DRC会在Decode实例上缓存历史请求的KV Cache。

当Prefill端发现某个请求命中了前缀缓存,它就不需要把整个上下文的KV Cache全量传过去,只需要传那一点点“增量”即可。

在90%的平均命中率下,DRC理论上能将跨集群的带宽需求降低高达10倍,初步缓解了带宽瓶颈。

然而,带宽虽然降下来了,延迟问题却依然棘手。

洞察3:智能体工作负载下的“非均匀延迟”

在DRC技术的加持之下, KV Cache传输数据量得以降低了一个数量级,于是,跨集群PD分离最棘手的痛点,集中在了KV Cache的传输延迟。

阅读原文
“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%! · AI Daily