国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源
By 思邈

AI 摘要
给它一张图,还你整个世界
原文正文
国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源
给它一张图,还你整个世界
允中 发自 凹非寺
量子位 | 公众号 QbitAI
李飞飞团队的世界模型榜单,刚刚换了新榜首。
登顶的是兔展智能团队联合北大、鹏城实验室研发的UniWorld-View(模型已适配国产昇腾算力):
你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频——
推、拉、摇、移,甚至“绕着场景360°转一圈”都可以,提供“精确听话的相机位姿控制”。
不管是单图3D生成还是视频4D生成,用的是“同一套代码、同一个模型”。
真·Uni(统一)World-View了,本次世界模型的训练数据来自北大系初创企业元空智能,代码和权重也已全部开源:
官方地址:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View
只看正脸,画出后脑勺
先说这事儿为什么难。
新视角合成(Novel View Synthesis),本质上是让AI“脑补”没拍到的角度。
而难点全在“大基线(large-baseline)”三个字上——
说白了就是:只给AI看正脸,让它画出侧脸,甚至后脑勺。
传统路线NeRF、3DGS,走的是“重建”逻辑:看得越多,建得越好。
可随手拍的单目视频,视角覆盖约等于没有。喂给它们,轻则空洞伪影满天飞,重则直接摆烂。
生成式路线倒是敢画。但大多数方法只是把相机位姿当个“口头指令”(一个抽象的条件向量)塞进扩散模型——
没有显式3D建模,走两步就飘,转大角度直接失控。
于是近两年出现了第三条路:
先用几何模型把画面撑成3D点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。
几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达GEN3C,走的都是这条路。
但在研发过程中,团队发现,这条路上藏着一个大家都踩过、却没人认真填的坑。
点云渲染,会“穿帮”
坑就出在点云渲染这一步。
点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。
视角一转大,渲染图会出现两种经典穿帮:
一是前景背景撕裂。
深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。
二是背面漏光。
点云没有“面”的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。
小幅度换视角时,这些穿帮不明显,生成模型还能糊弄过去。
可一旦上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。
UniWorld-View的第一板斧,就砍向这里——“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。
第一招:双重投影(Double-Reprojection),专治撕裂。
把源画面投影到目标视角,再原路投影回来。
来回一倒腾,凡是“回不来”的像素,就是会被遮挡的区域。
把这些区域沿相机轨迹逐帧累积成遮挡mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。
第二招:法向过滤,专治背面漏光。