不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
By Jay

AI 摘要
奇异摩尔首次亮相WAIC 2026
原文正文
不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
奇异摩尔首次亮相WAIC 2026
允中 发自 凹非寺
量子位 | 公众号 QbitAI
7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海世博、张江、西岸“三地四馆”同步启幕。
作为行业领先的AI网络全栈式互联产品及解决方案提供商,奇异摩尔首次亮相WAIC 2026。
大会期间,公司成功举办“智联为擎 合一共进——AI网络前沿生态论坛”,为AI网络互联生态的协同创新搭建了深度对话平台。
上海人工智能实验室、香港科技大学(广州)、商汤科技、壁仞科技、九章云极、曦望科技、科华云、图灵量子、图灵芯擎等知名研究机构和企业,以及多家产业链上下游生态伙伴与行业嘉宾齐聚一堂。
在本次论坛上,国产超节点生态共建倡议行动正式启动,并重磅发布《共封装光学(CPO)技术白皮书》,进一步彰显奇异摩尔推动产业协同的前瞻布局。
此外,奇异摩尔还携国产化超节点互联全栈解决方案、与壁仞科技联合打造的国产GPU直通国产RDMA网卡通信技术IBGDA Demo以及下一代光互联合作成果等核心技术及产品集中亮相,全面展示公司在算力网络互联领域的技术突破与生态成果,向全球观众呈现了中国AI算力生态的自主创新力量。
奇异摩尔创始人兼董事长田陌晨在论坛致辞中表示,连片成林,方能御风守固。正是基于对“连片成林”的深刻认知,奇异摩尔自创立以来,始终致力于成为AI网络互联生态的积极建设者与连接者。我们深知,网络互联是打破算力孤岛、让单个强点连成高效系统的关键脉络。没有哪一家企业能够独自走完从底层芯片到顶层应用的全链条;只有把生态做大,企业才能更强。
全国产化超节点互联全栈方案首次亮相,打通系统级协同脉络
当前国产算力面临的核心困境,并非单芯片性能的落后,而是“单点强、系统弱”的结构性失衡。
各家芯片性能虽不断突破,但片内、片间、网间、集群间各层互联各成体系,缺乏统一的全栈视角与系统级协同。
这种长期割裂直接导致系统级性能无法随芯片数量的增加而线性释放,算力资源被严重碎片化。
在以互联为核心的超节点时代,该短板会被无限放大。
奇异摩尔长期深耕AI网络互联领域,目前产品布局覆盖从Scale-Out网间互联、Scale-Up超节点XPU间互联到下一代光互联的全栈式解决方案。
针对上述行业现状,在本届WAIC上,奇异摩尔国产化超节点互联全栈解决方案首次亮相,并以超节点机柜直观呈现国产AI算力基础设施从“单点芯片突破”迈向“系统级协同优化”的跨越式发展,为大规模国产AI算力集群建设提供了自主可控的全栈互联底座。
奇异摩尔联合创始人兼产品及解决方案副总裁祝俊东指出,这套全栈方案的核心价值,在于为国产AI算力提供了一套可演进、可协同、不绑定的系统级基础设施。芯片厂商可基于统一底座灵活构建超节点系统,上层应用可无缝获得横向扩展能力,产业生态得以从各自为战走向合力突围。国产算力正处关键历史节点,互联已不再是配角,而是决定系统整体效能的核心命脉。奇异摩尔愿以开放、高效的全栈互联技术,为国产AI产业铺就通往未来的路。
IBGDA DEMO:国产GPU与RDMA网卡的深度协同
前述全栈方案覆盖了从片内互联到网间互联的多个层面,而其中一项最具实战意义的技术验证,便是国产GPU与国产RDMA网卡之间的直连通信——这正是本次奇异摩尔与壁仞科技联合展示的IBGDA解决方案。
在MoE模型的典型训练或推理中,专家并行通信包含两个核心阶段(Dispatch和Combine),每个阶段都涉及海量的小粒度数据交换。
传统跨节点通信中,GPU须经由CPU中转指令,由此产生额外延迟与CPU开销。
IBGDA技术通过绕过CPU处理环节,显著降低指令中转等待时间,充分释放GPU在并行计算中海量线程的吞吐优势,在All-to-All通信场景中实现吞吐提升与延迟压降的双重收益。
在国际方案与国产方案的对标中,英伟达凭借其GPU与ConnectX系列网卡的深度协同,率先实现了IBGDA方案,为大规模AI推理场景提供了成熟的延迟敏感型通信能力。
而国产集群要实现同等能力,国产化GPU需先满足对类NVSHMEM编程及最新NCCL通信库,以及DeepEP等集合通信库的支持,并与国产RDMA网卡在软硬件层面完成适配,方能实现GPU直通网卡的高效通信。
然而,目前国产GPU对IBGDA的支持主要停留在与英伟达网卡的适配上,国产GPU直通国产RDMA网卡的规模化落地案例仍相对罕见,这一环节成为制约国产化集群通信效率提升的短板。
这一局面正在被打破。奇异摩尔推出的单通道400G RDMA ASIC引擎,基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库(对标DeepEP),并原生支持IBGDA(GPU直接发起通信)机制。
本次WAIC大会上,奇异摩尔携手壁仞科技,联合展示了国产GPU直通国产RDMA网卡的IBGDA解决方案 。
该IBGDA Demo测试平台对标英伟达IBGDA测试数据,实测结果达到相应水平。
测试结果表明:IBGDA相较传统IBRC在小包、高频、强同步场景下呈现出代际优势。
单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现质的跨越;All-to-All通信延迟大幅缩短,接近翻倍提升;
尤为关键的是,传统方案小消息时延,远超大消息的“小包惩罚”被彻底消除。
值得强调的是,该方案基于开放的以太网生态构建,继承以太网部署灵活、成本可控优势的同时,为国产算力集群提供了一个兼具高性能与自主性的Scale-Out网络选择。
这一联合演示极具含金量,通过软硬件的深度协同,绕过繁琐的协议转换,大幅降低通信延迟,显著提升AI推理集群的整体处理效率。
这是对“国产芯+国产网”最佳实践的生动诠释,更以实测数据证明了国产算力生态已具备底层互通、系统级协同优化的实战能力。
布局OSU超节点互联芯粒,锚定下一代光互联技术路线
本次论坛的另一大核心亮点,是《共封装光学(CPO)技术白皮书》(以下简称“白皮书”)的发布。
《白皮书》由香港科技大学(广州)发起,奇异摩尔携手曦望Sunrise、壁仞科技、图灵量子、奇点光子等单位共同参与编写,凝聚了产学研各界的集体智慧。
《白皮书》系统梳理了CPO的技术路径、产业挑战与未来演进方向,为国内光互连技术标准化落地与规模化、产业化发展提供权威指引与实践参考。