发展趋势量子位5/10

不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面

By 克雷西

不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面
图源:量子位

AI 摘要

大模型时代的共同选择

原文正文

不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面

大模型时代的共同选择

克雷西 发自 上海

量子位 | 公众号 QbitAI

先说一件有意思的事。

就在今天的WAIC论坛上,MiniMax和阶跃星辰,同时出现在了一家AI Infra公司的论坛现场,前者参加战略合作签约,后者发布主旨演讲。

苗头其实更早就出现了。4个月前的中关村论坛上,智谱张鹏和Kimi杨植麟就曾与这家公司联合创始人兼CEO同框,参与圆桌论坛,并被现场点名该公司已为Kimi、智谱提供服务。

四家国产头部基模公司,先后跟同一家AI Infra达成了深度合作。开句玩笑话——集齐四家,就可以召唤神龙了。

这家AI Infra公司,正是无问芯穹。

这个身位有点像「电池领域的宁德时代」——造车的人可以「兄弟登山,各自努力」,但电池这一层,绕不开就是绕不开。无问芯穹想做的,就是大模型时代的共同选择。

问题也因此变得更有趣了:

他们到底看中了这家公司什么?

答案要从两头找。

需求端,2026年推理开始反超训练,成为AI算力消耗的主战场,推理成本两年降了280倍,企业的AI总支出却没降反升,中国日均Token调用量已经突破140万亿,一年涨了四成,需求呈指数级往上冲。

供给端却完全是另一副面孔。物理算力的扩产逻辑还是线性的,多修几个机房、多买几张卡,缺口却在三五年内都填不平。

一边指数增长,一边线性爬坡,中间那道口子,就是无问芯穹想站进去的位置。

更难的是,模型部署得好不好,外人很难判断。

一个请求发下去,模型正常回复了,但输出的精度可能已经悄悄掉了三成,这种问题常规监控查不出来。

等到用户在业务里察觉到不对劲,模型的招牌已经砸了。

这道看不见的门槛,才会真正决定哪家供应商能留在牌桌上。

为什么国产大模型优选无问芯穹?

Token经济全面爆发以来,推理需求正在加速,算力缺口也在持续扩大。

但MaaS这门生意的门槛,比外界想象的高得多。

Kimi、智谱、MiniMax、阶跃星辰为什么都点了头,自然有他们自己的算盘,但本质上是同时把三件事押了上去——

比如:模型效果会不会打折,成本烧不烧得起,出了问题稳不稳得住。

先说效果。

前面提到的那种隐蔽滑坡,是这个行业最让人头疼的地方。

有第三方供应商部署模型后,精度比原厂掉了30%,客户自己甚至察觉不到,直到业务指标开始下滑才回头排查。

无问芯穹在这件事上的做法,是定了一套准入测试标准。

这套标准,会从工具调用的一致性,到推理模式的精度对齐,逐项进行核验,每一个新模型上架前都要过这道关。

结果是,客户无论走无问芯穹还是原厂API,体验几乎感觉不到差别。

再来是成本。

无问芯穹在今年WAIC官宣了一项自研的硬技术——跨集群异构PD分离。

大模型推理里的Prefill和Decode是两个负载完全不同的阶段,硬件需求也不一样,拆开部署能让不同类型的芯片各自干最擅长的事。

但拆到不同机房后,会撞上一个新问题。

PD分离之后,需要在异构芯片之间用广域网以太网传输KV Cache,面临着带宽低、延迟高的情况,等于两个接力选手各自都跑得很出色,但在交棒的时候,却掉了链子。

为此,无问芯穹首先把Decode实例设计的Radix Cache技术,创新性地迁移到了这套跨集群架构里,让传输的数据量直接降低一个数量级。

接着,他们又首创了PDD架构,把传统的PD链路拆成P、RelayDecode、MainDecode三级。

遇到传输延迟高的请求,RelayDecode先顶上去把Token吐给用户,用户完全感觉不到这段实际长达数十秒的延迟,等数据传完,再无缝切给MainDecode接手。

实测显示,该架构在首Token延迟(TTFT)降低51.5%的同时,单Token成本可降低37.5%。

阅读原文
不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面 · AI Daily