发展趋势量子位5/10

亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群

By 克雷西

亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群
图源:量子位

AI 摘要

出海AI,正被“三重算力锁链"捆死

原文正文

亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群

出海AI,正被“三重算力锁链”捆死

克雷西 发自 凹非寺

量子位 | 公众号 QbitAI

DAU破亿,本该是所有应用开发者开香槟庆祝的荣耀时刻。

翻开全球亿级App的名册——微信、TikTok、Instagram——绝大多数产品只能望其项背。

现在,一家主打“AI穿搭 + 购物推荐”的出海应用真的跻身进了这个顶流俱乐部。只需用户上传一张自拍,AI就能在手机锁屏界面为其实时生成逼真的生活场景合成图并精准导购。

可翻开后台账本,创始人和CTO却怎么也高兴不起来。

因为急速膨胀的用户规模,并没有带来滚滚财源,反而变成了一台深不见底的“碎钞机”。

团队算了一笔极其残酷的细账:在新兴市场,他们把广告和变现收入平摊到每个用户头上,得到的ARPU(单用户平均收入)只有2美元。

那么,花在每个人身上的云端算力和传输成本是多少呢?答案是:3美元。

相当于每获取并留住一个活跃用户,公司后台就要净倒贴1美元!

也就是说,用户来得越多、锁屏刷新越频繁,公司的现金流失血就越快。这种“越跑越亏”的死循环,直接把团队逼到了商业化生存的悬崖边。

当大家都在疯狂卷大模型时,底层的云基础设施,到底是如何把一家亿级App拖入死亡陷阱的?

出海AI,正被“三重算力锁链”捆死

为了搞清楚这笔钱是怎么烧掉的,我们需要拆解一下这款App之前的云端运行模式。

他们此前租用了某全球Top 2云巨头的GPU服务,来部署开源模型生成图像。而当时配置的算力芯片,是英伟达的L4 GPU。

高昂且空转的“算力租金”

大厂的价目表显示,L4实例根据配置不同,价格在每小时$0.7到$8不等。而实测显示,用L4生成一张AI高清图,耗时整整需要12秒。

按最便宜的$0.7/小时极端低价来算,生成一张图的纯算力成本就是$0.0023。

该App的机制是后台自动更新锁屏,用户上传自拍后,系统每天约产生3次等效推理。算下来,每个用户每年光是“租卡费”就要烧掉大约2.55美元。

更致命的是“空转成本”,2.55美元的前提是GPU必须7×24小时满载运转。只要业务有波峰波谷、GPU存在闲置空转,平摊到每张图上的真实成本就会轻松击穿3美元。

躲在账面后的“天价流量税”

算力贵也就算了,更狠的一刀砍在出站流量费(Egress Fee)上。

传统云厂商给出的报价,通常只包含显卡和CPU。但生成出来的图片要传输到海外用户手机上,流量必须额外计费。

单张图几MB看起来不起眼,但在亿级日活的基数放大下,跨境出站流量直接变成了天文数字。一位出海AI负责人曾痛心吐槽:“在传统大厂云上,业内常说‘算力花一万,流量花五千’。”

物理“光速墙”与算力损耗

此外还有逃不掉的网络延迟。

许多出海应用将服务部署在少数几个中心数据中心,但用户却分布在全球。光纤传输存在物理极限,跨国往返延迟动辄上百毫秒。

行业实测显示:仅仅因为14ms的网络往返延迟,就会让GPU利用率直接打七折(导致30%算力空转浪费)。 算力贵、流量狂飙、延迟又让显卡空转——三重负担叠加,出海AI团队根本不堪重负。

换一套GPU方案,把天价账单“平替”掉

面对“越跑越亏”的绝境,这家企业没有坐以待毙。在评估了全球多家云服务商后,他们做出了一个大胆的决定:转向Akamai推理云,并将GPU选型重构为NVIDIA RTX PRO 6000。

这并不是一张传统意义上的旗舰训练卡,但对于AI推理而言,它却是绝佳的“降维打击”武器。

换上RTX PRO 6000后,凭借更先进的架构与96GB超大显存(完美吃下大模型与高并发KV Cache),生成耗时从12秒直接被压缩到了3-5秒。

算力时长被砍掉一大半,需要的服务器集群规模更是直接缩减了75%。虽然RTX PRO 6000的单卡小时租金高于L4,但由于生图速度快了4倍、所需总卡数减少了3/4,最终摊销到每张图上的推理总成本,反而比L4便宜得多。

为什么不直接上顶配训练卡H100?

有人可能会问:为什么不上更顶级的H100?

答案在于量化格式。H100架构不支持原生FP4精度,最低只到FP8。而RTX PRO 6000原生支持FP4,能在几乎不损失模型精度的前提下,把显存需求再砍掉一半。

在推理专精赛道上,RTX PRO 6000的推理吞吐量最高可达H100的1.63倍,而综合成本反而比H100便宜14%。

此前,某亚太区情感陪伴App使用大厂A100跑多模态对话,同样陷入“多跑多亏”的泥潭。在换用Akamai的RTX PRO 6000并应用FP4量化后,综合成本暴降60%,一举实现了扭亏为盈。

阅读原文
亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群 · AI Daily