“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!
By 思邈

AI 摘要
最新完整技术报告出炉
原文正文
“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!
最新完整技术报告出炉
允中 发自 凹非寺
量子位 | 公众号 QbitAI
在刚刚落幕的2026 WAIC世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构PDD。
现在,完整技术报告来了。
技术报告地址:https://github.com/infinigence/pdd
该架构以高性价比的广域网以太网串联多地已建成的同构数据中心,并将传统的PD分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构。
在让“偏科”的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下KV Cache的传输延迟痛点。
实测数据显示,该架构在实现了首Token延迟降低51.5%的同时,单Token成本可降低37.5%。
这不仅意味着用户端速度体验得到了显著提升,更实现了全域异构算力的最大化调度,让分散各处的存量集群资源能够充分释放产业价值。
今天,无问芯穹推理团队将首次分享这一架构的设计推演全貌,深度还原技术创新背后的思考路径与攻坚细节。
跨集群异构推理的理想与现实
过去的一年里,大模型推理的成本和效率,成为了整个行业共同面对的“生死线”。
行业共识在于:LLM的推理存在Prefill(预填充,计算密集型)和Decode(解码,访存密集型)两个特性迥异的阶段。
理论上的最理想的解法是“异构分离”路线:让算力强的卡负责Prefill,让显存带宽高的卡负责Decode。
但现实是骨感的。
要在同一个集群里构建大规模异构算力资源,不仅采购成本极其高昂,且一旦模型架构变了,这些固定配比的硬件就会很容易出现部分闲置的情况。
于是,一个很自然的想法冒了出来:
为什么不把分布在各地的、已经建好的同构集群,用低成本的广域网以太网连起来,做跨集群的异构分离式推理呢?
这一想法看似水到渠成,但一旦将其落到具体工程实践中,便立刻撞上了一堵“叹息之墙”——KV Cache的跨集群传输带宽和延迟瓶颈。
PDD架构也正是为了攻克这一难题而设计的。
但在深入这一架构的设计与实现细节之前,想先与大家分享无问芯穹团队在前期研究中发现的几个极其关键的“底层规律”,它们也是整个跨集群PD方案能够成立的核心前提。
痛点与洞察:硬件“偏科”与流量的“二八定律”
要理解PDD的设计,得从无问芯穹在PDD技术报告中Background部分揭示的三个核心Insights入手。
洞察1:硬件性能的“极度偏科”
LLM推理的Prefill与Decode两个阶段对硬件资源的需求是南辕北辙的,无问芯穹团队在内部基准测试中也发现,芯片的性能是极度“偏科”的:
以8卡的某旗舰高性能GPU为基线,某厂商的E芯片在处理计算密集的Prefill阶段时,只能达到基线约81%的性能;但在访存密集的Decode阶段,它却能爆发出基线210%的性能。
如果把这类“偏科”芯片放在同构集群里,既要扛Prefill计算又要做Decode输出,非但自身的长板优势无从发挥,反而会拖慢Prefill阶段的整体效率。
这一发现强烈激发了无问芯穹团队将Prefill与Decode拆分解耦、分别部署在最适合它们的硬件上这一想法。
洞察2:DRC技术带来的10倍“带宽”
仅仅考虑计算和访存还不够,跨集群传输庞大的KV Cache会瞬间吃掉广域网的带宽。
但好在Agent业务有个显著的特征:前缀缓存命中率极高。
利用这一特性,团队在Decode端部署了前缀缓存RadixCache(简称DRC)。
简单来说,DRC会在Decode实例上缓存历史请求的KV Cache。
当Prefill端发现某个请求命中了前缀缓存,它就不需要把整个上下文的KV Cache全量传过去,只需要传那一点点“增量”即可。
在90%的平均命中率下,DRC理论上能将跨集群的带宽需求降低高达10倍,初步缓解了带宽瓶颈。
然而,带宽虽然降下来了,延迟问题却依然棘手。
洞察3:智能体工作负载下的“非均匀延迟”
在DRC技术的加持之下, KV Cache传输数据量得以降低了一个数量级,于是,跨集群PD分离最棘手的痛点,集中在了KV Cache的传输延迟。