这个新生图模型有点夯:4K直出的,国产的,开源的!
By 十三

AI 摘要
商汤预览了SenseNova U1.5 Lite
原文正文
这个新生图模型有点夯:4K直出的,国产的,开源的!
商汤预览了SenseNova U1.5 Lite
金磊 发自 凹非寺
量子位 | 公众号 QbitAI
刚刚,新出的一个生图模型,着实是有点东西在身上的:
国产的,4K直出的,开源的,轻量的,还是可以指哪儿改哪儿的。
例如下面这张信息密度超高的图片,就是它做出来的:
我们从结果可以看到,即便是把图片放大了来看 ,不论是文字、图片元素,都是细节拉满的状态。
再如这组充满艺术感的视觉大片,这个AI也是不在话下:
那这是何许AI是也?
它,便是商汤刚刚面向社区开源的SenseNova U1.5-Lite-Preview。
这是一个轻量级原生统一多模态模型的早期预览版本。它延续了商汤自研的NEO-Unify架构,把语言、视觉语义和像素生成放进同一套模型里,覆盖视觉理解、推理、生成与编辑。
不过有一说一,原生4K直出,还仅仅是它的亮点之一。
在仅有8B-MoT参数的轻量身形之下,U1.5-Lite-Preview做到了:
- 复杂Prompt能接住:支持长篇、多约束、层次化和结构化视觉指令;
- 文字和版式更能打:面向海报、信息图、品牌视觉等高信息密度内容;
- 生成后还能继续改:支持参考图、多图组合、局部文字编辑,以及红框、坐标和marker精准编辑。
毕竟在真实创作中,“会画图”只是第一步,真正决定它能不能进入创作流程的,还得看复杂任务和编辑能力。
那U1.5-Lite-Preview这个8B-MoT小模型创作起来有多方便?我们继续往下看~
能Hold住复杂创作和编辑才是重点
先来看一张信息密度相当的图片。
这张图的主题是银盐摄影。
画面正中央,是一台被拆解开的复古相机。镜头、快门、胶片仓、卷片轴、取景器等结构,被一层层摊开来讲清楚;一束橙色光线从镜头前方打进来,顺着成像路径一路穿过去,整张图的视觉中心也因此一下子立住了。
这种图最难的地方,其实并不在于“画一台相机”本身。真正难的是,模型得同时把时间线、知识模块、结构拆解、流程说明和视觉层级都组织进同一张图里,还得让人一眼看过去,知道哪里是主干、哪里是补充,哪里是说明,哪里是结论。
从最后出来的效果看,U1.5-Lite-Preview在这种高信息密度的信息图任务上,已经能把内容和版式一起接住了。黑白蚀刻风格很统一,主视觉够醒目,细节也足够丰富,整张图读起来并不乱,反而有种“越看越有东西”的感觉。
如果说上一张图考验的是“从零做一张复杂信息图”,那接下来这组,更像是在考模型有没有复刻一张图的逻辑,再重新输出的能力。
输入图的主题,是一张名为Modern Pop Culture Film & TV Milestone Journey的信息图。
它把几部流行影视作品串在一条弯曲的路径上,节点、卡片、插画和标题都带着比较统一的手绘水彩风格。整张图看上去像一张轻松、亲切的文化主题路线图。
而到了输出图,主题换成了The Journey of Postal Mail,也就是“邮政邮件的旅程”。
但你再仔细看,会发现它并没有推倒重来。
原来那条弯弯曲曲的路径还在,节点式的节奏也还在,左中右的版式关系也保留了下来。只不过,原先围绕电影和剧集展开的内容,被整体替换成了“投递、分拣、运输、派送”这四个环节。洗衣店、剧集卡片、电影海报式的小模块,被换成了邮筒、分拣中心、运输车、邮差上门这些更贴合新主题的元素。
换句话说,它领悟的并不只是简单的“画风”,更是一整套设计框架和组织方式。
在真正的内容生产中,从头做图只占一部分时间;更多时候,折磨人的其实是改稿。
比如下面这组博物馆文创的案例:
输入图和输出图,主题其实都是博物馆文创开发流程。
整张图的大框架没有变。左侧仍然是竖排标题,中间依旧是巨大的“MUSE”字样,右侧还是从“研究与挖掘”到“反馈与迭代”的六步流程,底部的价值模块和整体米色、浅棕色的调性,也都还在。
但它改动的,是画面里最核心的主视觉。这个案例挺像真实工作流里常见的改法。
文案不一定大改,结构也不一定重做,但客户会告诉你,主题方向变了,主视觉要换,气质要跟着调整,原来的信息框架尽量保留。这时候,难点已经不只是“生成一张图”,而是在同一套版式里,重新组织新的视觉主体。
从这个结果来看,U1.5-Lite-Preview已经开始具备这种能力了。它不是简单地把一件新文物塞进去,而是在保留原有流程信息图框架的前提下,把新的核心元素重新放进整张设计语言里。
我们再来看一个更刁钻的,把有设计感且复杂的“迎”字,改成“命”字: