业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
By 梦晨

AI 摘要
一颗“不走寻常路”的芯
原文正文
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
一颗“不走寻常路”的芯
允中 发自 凹非寺
量子位 | 公众号 QbitAI
这几天,全网被WAIC“霸屏”,从具身智能到国产算力,这场一年一度的AI盛典,同样吸引了科技圈所有目光。
今年WAIC堪称是国产芯片和算力企业的斗秀舞台,108款芯片、超200款智算产品齐聚上海。除了全员大集合外,我们还看的一个明显的变化:
过去各家比的是”我这颗芯片算力多少”,单卡性能多么牛;而今年,提到最多的是“系统创新”与“高效协同”。换言之,单卡比拼的时代已落下帷幕,大规模计算系统性能的较量即将开启。
算力芯片群星闪耀,我们也发现了一颗“不走寻常路”的新星(芯)。
浦东张江,太初(杭州)集成电路有限公司(“太初元碁”)展位里外围满了人,抛开展位处于主通道上的地理位置不谈,更吸引目光的,是一台大型超节点集群,号称“超智融合”的计算系统,旁边刚揭幕的自研芯片——标签写着:异构众核,双模设计。
先拼架构,再谈单卡
“算力产业已从单卡性能比拼进入系统级竞争阶段。”太初元碁CEO杨晋喆如是说。
这话不是场面话。模型参数突破万亿级,Agent和AI4S对CPU-GPU协同的要求越来越高,单纯堆算力的边际收益正在递减。降低单位算力成本,才是当下真正的核心命题。
这个判断与整个行业的演进方向一致。今年WAIC上,华为展出了Atlas 950 SuperPoD超节点,沐曦发布“曦景”S系列超节点,阿里平头哥也拿出了真武M890×磐久AL128超节点。
国盛证券在近期研报中直接点明:国产超节点迎来量产元年,算力竞争范式正从单点峰值性能全面转向系统级全栈效率的比拼。
太初元碁给出的技术答案是HCU异构融合计算架构。核心思路是把CPU和AI算力核放在同一条高速总线上,支持M:N可重构配比——CPU负责Agent调度和数据预处理,XPA算力阵列专注大模型推理计算,再配合共享分级存储,实现冷热数据动态调度。
翻译成大白话:一块芯片里塞了两类“大脑”,一个管调度协调,一个管高强度计算,两者还能按需调配比例。这种设计的好处在于,面对不同负载时不用“大炮打蚊子”,也不用“小马拉大车”,算力分配可以动态匹配。
为什么异构众核成了必选项?
这得从Agentic AI时代的算力需求变化说起。
传统AI训练和推理集群通常采用“单路CPU搭配4至8颗GPU”的固定配置,CPU长期充当算力宿主,仅负责任务下发、数据调度与GPU资源托管。
进入Agentic AI智能体时代,智能体需要自主完成任务拆解、工作流编排、外部工具调用、长期记忆管理全闭环运行,CPU在规划、决策、交互类通用计算中的算力权重与负载占比出现结构性显著提升。
AMD CEO苏姿丰在2026年Q1财报电话会上透露,单个计算节点中CPU与GPU的数量正从过去的一对多,逐步趋近一比一,未来甚至可能出现CPU数量多于GPU的情况。
阿里云的判断也类似:Agent“有状态调度+无状态执行”的混合模式,对资源精细化管控提出了更高要求,算力系统的优化重心正全面由单卡峰值性能转向CPU-GPU的高效协同。
太初元碁的HCU架构,本质上是在芯片层面提前响应了这个趋势。把CPU和AI核放在同一条高速总线上,相比传统“CPU+独立加速卡”的分离架构,I/O损耗更低,协同效率更高。
一颗芯片可打两份工
基于HCU架构,太初元碁发布了新一代国产AI自研芯片T2 Ultra。最值得看的正是它的双模式设计。
T2 Ultra有两种工作模式:自主计算模式下,芯片可以独立承担完整计算任务;加速模式下,则配合主机协同工作。
这意味着同一颗芯片,既能作为独立算力节点部署在边缘或中小规模场景,也能作为加速卡插进大型集群里当”算力引擎”。
具体再看T2 Ultra的性能参数,HPC算力(FP64)为38 TFLOPS,可满足科学计算需求;FP4算力则高达4800 TFLOPS(稀疏算力),FP16算力1200 TFLOPS(稀疏算力)应对各种AI训推场景,原生支持FP64至FP4、实现全精度覆盖。
对于客户来说,这种灵活性的实际价值在于:不用为不同场景采购不同硬件,一套芯片体系覆盖多种部署需求,采购和运维成本都能压下来。
在国产AI芯片普遍面临“量产难、落地更难”的当下,能不能让客户用得起来、用得起,比纸面参数重要得多。
不只是跑大模型
如果说T2 Ultra是“心脏”,那元碁HyperIntelliX超智融合计算系统就是整个“身体”,定位为面向 AI+AI4S 的全国产智算+超算融合计算平台。
值得注意的是,HyperIntelliX不只是跑大模型,同样也能在AI4S领域发挥价值。针对AI4S领域,太初元碁同步披露了相关落地成果:
全球气象预测可视化系统、TecoQSim量子经典模拟器、大规模虚拟药物筛选——覆盖气象、量子计算、生物医药三个方向。
多数国产AI芯片目前还停留在“跑通大模型推理”的阶段,能同时支撑AI和AI4S双线任务的平台并不多见。
这个定位有其行业背景。AI4S(AI for Science)对算力的需求与纯AI推理不同:科学计算通常需要高并发、大吞吐、长时任务,且对双精度计算能力有硬性要求。
太初元碁团队有三次获得高性能计算领域国际最高奖项“戈登·贝尔奖”的积淀,在超算领域的经验为其切入AI4S提供了技术底气。
生态迁移:国产芯片真正的硬骨头
俗话说“是骡子是马,拉出来遛一遛”,硬件再强,也得有人用,才能谈得上“可用”,进而朝“好用”转变。
太初元碁WAIC期间发布了两款生态产品,直指国产芯片最头疼的“迁移成本”问题。