发展趋势量子位5/10

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

By 思邈

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源
图源:量子位

AI 摘要

给它一张图,还你整个世界

原文正文

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

给它一张图,还你整个世界

允中 发自 凹非寺

量子位 | 公众号 QbitAI

李飞飞团队的世界模型榜单,刚刚换了新榜首。

登顶的是兔展智能团队联合北大、鹏城实验室研发的UniWorld-View(模型已适配国产昇腾算力):

你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频——

推、拉、摇、移,甚至“绕着场景360°转一圈”都可以,提供“精确听话的相机位姿控制”。

不管是单图3D生成还是视频4D生成,用的是“同一套代码、同一个模型”。

真·Uni(统一)World-View了,本次世界模型的训练数据来自北大系初创企业元空智能,代码和权重也已全部开源:

官方地址:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View

只看正脸,画出后脑勺

先说这事儿为什么难。

新视角合成(Novel View Synthesis),本质上是让AI“脑补”没拍到的角度。

而难点全在“大基线(large-baseline)”三个字上——

说白了就是:只给AI看正脸,让它画出侧脸,甚至后脑勺。

传统路线NeRF、3DGS,走的是“重建”逻辑:看得越多,建得越好。

可随手拍的单目视频,视角覆盖约等于没有。喂给它们,轻则空洞伪影满天飞,重则直接摆烂。

生成式路线倒是敢画。但大多数方法只是把相机位姿当个“口头指令”(一个抽象的条件向量)塞进扩散模型——

没有显式3D建模,走两步就飘,转大角度直接失控。

于是近两年出现了第三条路:

先用几何模型把画面撑成3D点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。

几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达GEN3C,走的都是这条路。

但在研发过程中,团队发现,这条路上藏着一个大家都踩过、却没人认真填的坑。

点云渲染,会“穿帮”

坑就出在点云渲染这一步。

点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。

视角一转大,渲染图会出现两种经典穿帮:

一是前景背景撕裂。

深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。

二是背面漏光。

点云没有“面”的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。

小幅度换视角时,这些穿帮不明显,生成模型还能糊弄过去。

可一旦上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。

UniWorld-View的第一板斧,就砍向这里——“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。

第一招:双重投影(Double-Reprojection),专治撕裂。

把源画面投影到目标视角,再原路投影回来。

来回一倒腾,凡是“回不来”的像素,就是会被遮挡的区域。

把这些区域沿相机轨迹逐帧累积成遮挡mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。

第二招:法向过滤,专治背面漏光。

阅读原文
国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源 · AI Daily