发展趋势量子位5/10

全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

By henry

全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型
图源:量子位

AI 摘要

单卡突破10000 video tokens/s,Vivix打通实时多模态生成全链路

原文正文

全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

单卡突破10000 video tokens/s,Vivix打通实时多模态生成全链路

henry 发自 凹非寺

量子位 | 公众号 QbitAI

要我说,诺兰的《星际穿越》,还是拍保守了。

电影里,两个平行时空的交汇,要靠摩斯密码。

而今天,AI已经能“附”到任何物体或角色身上,让它们在另一个世界里开口、行动,和你实时视频通话。

比如,这只小猫可以一边说着土味情话,一边弓背、摇尾巴、抬爪子,还能在自己的世界里来回走动(注意看,它脚下的影子也会随之变化)。

重要的是,这些反应并不是提前编排好的。

小猫会跟着你的声音即时变化:你说一句,它就根据新的输入作出新的动作和回应。

而这只小猫背后,就是Vivix最新发布的实时交互多模态模型A1。

A1让用户可以像打视频电话一样,与屏幕另一端的虚拟角色持续交流。

相比传统数字人和视频生成模型,A1最大的不同在于——

屏幕里的角色真正拥有了身体。它不再只是对着镜头说话,而是能够行动、转身、改变姿态,并与所在世界里的物体和环境持续互动。

可以说,这种感觉,真的像在和另一个平行世界连线。

与此同时,为了让角色背后的世界也变得更加丰富,Vivix还同步推出了W1。

W1让用户不再只是站在屏幕外看故事,而是可以随时介入,改变人物的选择、行动,以及接下来的剧情走向。

看到这里你可能会想:这得多吃算力啊?

但据Vivix官网技术博客介绍,A1虽然拥有近30B激活参数,却通过MJD、原生NVFP4训推策略和一套自研的通信-计算调度+mega-kernel推理基础设施,将部署门槛极致地压到了消费级GPU实时推理,近似画质下推理效率提升了近两个数量级。

与此同时,其流式调度器响应新输入的时间最短为300毫秒,从用户发出输入,到画面首次出现可见反应,延迟平均0.6秒。

也就是说,这边话音刚落,屏幕另一端的角色基本已经动起来了。

官方现已开放内测,欢迎访问官网及API开放平台申请体验:https://vivix.ai/

它究竟是怎么做到的?

统一流式架构与原生交互建模

这通平行世界的视频电话要真正接通,第一步不是让角色回答得多聪明,而是让它在持续生成过程中,始终还是同一个角色、身处同一个世界。

Vivix将A1定位为全球首个在一套原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型。

拆开来看,A1在模型层面主要做了三件事:

参考条件要持续生效,新的交互要随时插进来,音频和视频还得一直往下生成。

统一多模态参考、交互与流式生成

为了实现上面的效果,A1首先把多模态参考、实时交互和视频生成,统一进了一套原生流式架构。

这听起来像是把几个模块接在一起,但真正困难的地方在于:

模型既要随时响应用户的新输入,又要在不断向前生成的过程中,维持角色、物体和场景的长期一致性。

传统clip-based视频模型通常一次生成一个完整片段,由于可以提前看到整个片段,它能够统筹前后的动作和画面,相对容易保证人物、场景和物体关系不发生明显变化。

流式生成却没有这样的条件,它不知道几秒之后会发生什么,只能一边看着已经生成的画面,一边接收用户刚刚发来的指令,实时预测下一段内容。

这就像一边铺铁轨,一边开火车。生成持续得越久,误差就越容易不断累积。角色的外形、位置和动作可能逐渐漂移,物体与场景之间的空间关系也可能被破坏。

最简单的解决办法,自然是让角色少动一点,用僵硬换稳定。

但一只不敢转身、不敢走动,甚至不能真正接触环境的猫,显然谈不上拥有身体。

A1的做法,是把图片、视频、声音、交互历史和已经生成的内容共同写入持续状态,让它们在后续流式生成中反复生效。

具体的,A1通过因果时序建模和流式状态维护,让相邻动作保持连续,并在更长时间范围内维持角色身份、场景和物体关系。

其中,局部连续性先验负责让相邻动作自然接上,全局序列先验则看住更长时间里的角色身份、场景和物体关系。

阅读原文
全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型 · AI Daily