老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了
By 听雨

AI 摘要
CUDA又危了?
原文正文
老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了
CUDA又危了?
听雨 发自 凹非寺
量子位 | 公众号 QbitAI
CUDA又双叒叕被创了…
这回动手的,还是英伟达亲手喂大的AI。
一家成立仅一年的小公司,用AI编程Agent,只花10小时,就搭出了一套「类CUDA软件」。
停停停。
你是说这套英伟达花了近20年搭起来的软件帝国,就这么被复刻了??
不止如此。DeepSeek也在尝试少写一点底层CUDA。
他们已经开源了一套名为TileKernels的GPU算子库,用TileLang来编写,省去了大量手写底层CUDA代码的工作。
不过类似的「CUDA危机」,咱也不是第一次听了。
每隔一段时间,CUDA都要被拎出来鞭打一番,动辄替代了、击穿了、护城河又被颠覆了…
真的是这样么?
10小时「复刻」CUDA
提起英伟达,很多人的第一反应是GPU。
H100、Blackwell、Rubin,靠着一代代性能更强的芯片,英伟达吃下了这一轮AI浪潮的最大红利。
但英伟达真正难以撼动的优势,其实不是硬件,而是软件。
芯片可以买,参数可以追,制程也会迭代。真正让客户用了英伟达之后很难再换走的,是围绕GPU建立起来的整套软件生态。
而CUDA,就是这套软件帝国的核心。
CUDA全称Compute Unified Device Architecture,由英伟达高管Ian Buck带队,花了近20年打造。
它常被叫作编程语言,但更准确地说,CUDA是一整套围绕英伟达GPU建立的软件平台。
如果简单拆成三层,最底下是内核层,直接让芯片干活的Kernel、编译器和运行时。
中间是库层——cuBLAS、cuDNN等经过高度优化的计算库,以及调试、验证和性能分析工具。
最上面,则是PyTorch、TensorFlow等开发框架,企业积累的海量代码和工作流,以及围绕CUDA成长起来的开发者生态。
△AI生成
这么说可能有点抽象,但你可以把英伟达GPU想象成一家工厂。
CUDA最底层负责告诉机器每一步怎么干,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。
所以,对客户来说,买到的不只是英伟达的一块卡,而是一座开箱即用的工厂。
现在,一位名叫Jeremy Nixon的老哥,带着AI Agent来了。
Nixon是AI软件初创公司Infinity的创始人,此前也在Google Brain当研究员。
他的团队开发了一套名为Ignition的AI研究Agent,专门给不同AI芯片编写底层软件。
它可以生成GPU Kernel、运行测试、寻找错误、测量性能,再根据结果自动改写代码。
人类工程师负责给出高层方向,剩下那些琐碎又费脑子的工作,就交给Agent反复循环。
就这样,Infinity用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件。
只花了10小时。
啊??
那些过去需要芯片软件工程师反复调试的底层代码,现在真能交给AI了?
还真不能说完全是炒作。
AI Agent确实很适合这种具有明确反馈的编程任务。