发展趋势量子位5/10

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型

By 鹭羽

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型
图源:量子位

AI 摘要

10秒1080P,成本只要5毛钱

原文正文

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型

10秒1080P,成本只要5毛钱

鹭羽 发自 凹非寺

量子位 | 公众号 QbitAI

再牛的大模型,也要放到行业面前公开露个面,才算真交卷。

现下,就有这样一支清华系团队再展锋芒,规模不大、实力却不小——

抢先用MoE架构把视频生成模型卷上千亿参数,代码权重还全!开!源!

模型一出,直接刷屏国内外科技圈。那么大,那么强,说开源就开源。

且先来看看生成效果一探究竟:

如何?最近爆火的AI漫剧,声台形表四角俱全。

亦或是来一场酣畅淋漓的长镜头,视角跟随人物动作切换自如。

闹归闹,商业场景也不在话下。

光这运镜、对焦和人物表现,拉出去和闭源第一梯队同台PK,也照样能打。

不卖关子了,这便是Sand.ai的最新力作——MAGI-2-preview。继Magi-1横空出世后,新模型又一次瞄准开源C位。

模型总参数114B,单次前向只激活约6B。

按8卡H100当下的行情算,要生成一段10秒1080P视频,其成本仅需5毛钱,差不多只有行业主流模型的十分之一。

Benchmark排名也相当亮眼,MAGI-2-preview在AA视频生成榜单排名第六。仅用6B激活参数,效果就已经非常接近第一梯队。

好好好,这下视频生成行业,又多了一个千亿级新变量。

视频模型Scaling不能照抄LLM

这一变,直击视频生成模型的Scaling路线。

其实这个问题现在看来挺刚需的,做大模型,最怕的事情就是钱不够烧。

文本模型倒还好,处理的都是离散token,叠参数、加算力,模型就能越滚越强。但视频模型呢?面对的却是一整个动态世界。

每一帧画面都要被拆成大量空间patch,连续帧还要记录人物动作、物体关系和镜头变化。如果再叠加文本、音频等信息,序列长度直接超级加倍……

如果还用稠密模型,Scaling的训推成本简直想都不敢想。

模型要更大、视频要更长、成本还要可承受,这三件事就是摆在视频生成面前的近乎「不可能三角」。

当然,解法不是没有——MoE。

所谓MoE,就是把模型容量和单次计算部分解耦。模型可以继续拥有百亿千亿的总容量,但每次推理只激活其中一小部分,成本相对可控。

但视频MoE也有自己的麻烦,首先卡住的是通信。

传统专家并行会先为token选出Top-K专家,再把token送到专家所在的GPU。换言之,只要激活专家数越多,需要运输的数据就越多。

对于本就拥有超长序列的视频模型,这部分通信成本很快就会盖过专家计算本身。

更别提训练稳定性,动态变化的路由、随时波动的专家负载,以及需要处理的多模态数据,都会让大模型Scaling过程中常见的问题,在视频MoE上成倍放大。

因此视频生成的Scaling路径,跟大语言模型不完全是一回事。

单纯迁移MoE不管用,还要扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。

说白了,得从底层开始一点点重构。

行业里很少有人能做到。要说将视频MoE从纸上谈兵搬到千亿参数视频模型上,Sand.ai是第一个。

让千亿MoE模型真正跑起来

要想跑通,架构和系统缺一不可。

先打地基,MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验证过的单流架构——

文本、视频和音频进入同一个Transformer,然后在每一层自注意力里直接交换信息。

传统做法里,是视频走视频的,音频走音频的,最后再靠cross-attention(交叉注意力)把两边粘起来。

阅读原文
114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 · AI Daily