全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型
By henry

AI 摘要
单卡突破10000 video tokens/s,Vivix打通实时多模态生成全链路
原文正文
全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型
单卡突破10000 video tokens/s,Vivix打通实时多模态生成全链路
henry 发自 凹非寺
量子位 | 公众号 QbitAI
要我说,诺兰的《星际穿越》,还是拍保守了。
电影里,两个平行时空的交汇,要靠摩斯密码。
而今天,AI已经能“附”到任何物体或角色身上,让它们在另一个世界里开口、行动,和你实时视频通话。
比如,这只小猫可以一边说着土味情话,一边弓背、摇尾巴、抬爪子,还能在自己的世界里来回走动(注意看,它脚下的影子也会随之变化)。
重要的是,这些反应并不是提前编排好的。
小猫会跟着你的声音即时变化:你说一句,它就根据新的输入作出新的动作和回应。
而这只小猫背后,就是Vivix最新发布的实时交互多模态模型A1。
A1让用户可以像打视频电话一样,与屏幕另一端的虚拟角色持续交流。
相比传统数字人和视频生成模型,A1最大的不同在于——
屏幕里的角色真正拥有了身体。它不再只是对着镜头说话,而是能够行动、转身、改变姿态,并与所在世界里的物体和环境持续互动。
可以说,这种感觉,真的像在和另一个平行世界连线。
与此同时,为了让角色背后的世界也变得更加丰富,Vivix还同步推出了W1。
W1让用户不再只是站在屏幕外看故事,而是可以随时介入,改变人物的选择、行动,以及接下来的剧情走向。
看到这里你可能会想:这得多吃算力啊?
但据Vivix官网技术博客介绍,A1虽然拥有近30B激活参数,却通过MJD、原生NVFP4训推策略和一套自研的通信-计算调度+mega-kernel推理基础设施,将部署门槛极致地压到了消费级GPU实时推理,近似画质下推理效率提升了近两个数量级。
与此同时,其流式调度器响应新输入的时间最短为300毫秒,从用户发出输入,到画面首次出现可见反应,延迟平均0.6秒。
也就是说,这边话音刚落,屏幕另一端的角色基本已经动起来了。
官方现已开放内测,欢迎访问官网及API开放平台申请体验:https://vivix.ai/
它究竟是怎么做到的?
统一流式架构与原生交互建模
这通平行世界的视频电话要真正接通,第一步不是让角色回答得多聪明,而是让它在持续生成过程中,始终还是同一个角色、身处同一个世界。
Vivix将A1定位为全球首个在一套原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型。
拆开来看,A1在模型层面主要做了三件事:
参考条件要持续生效,新的交互要随时插进来,音频和视频还得一直往下生成。
统一多模态参考、交互与流式生成
为了实现上面的效果,A1首先把多模态参考、实时交互和视频生成,统一进了一套原生流式架构。
这听起来像是把几个模块接在一起,但真正困难的地方在于:
模型既要随时响应用户的新输入,又要在不断向前生成的过程中,维持角色、物体和场景的长期一致性。
传统clip-based视频模型通常一次生成一个完整片段,由于可以提前看到整个片段,它能够统筹前后的动作和画面,相对容易保证人物、场景和物体关系不发生明显变化。
流式生成却没有这样的条件,它不知道几秒之后会发生什么,只能一边看着已经生成的画面,一边接收用户刚刚发来的指令,实时预测下一段内容。
这就像一边铺铁轨,一边开火车。生成持续得越久,误差就越容易不断累积。角色的外形、位置和动作可能逐渐漂移,物体与场景之间的空间关系也可能被破坏。
最简单的解决办法,自然是让角色少动一点,用僵硬换稳定。
但一只不敢转身、不敢走动,甚至不能真正接触环境的猫,显然谈不上拥有身体。
A1的做法,是把图片、视频、声音、交互历史和已经生成的内容共同写入持续状态,让它们在后续流式生成中反复生效。
具体的,A1通过因果时序建模和流式状态维护,让相邻动作保持连续,并在更长时间范围内维持角色身份、场景和物体关系。
其中,局部连续性先验负责让相邻动作自然接上,全局序列先验则看住更长时间里的角色身份、场景和物体关系。