量子位 昨天
这个新生图模型有点夯:4K直出的,国产的,开源的!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

刚刚,新出的一个生图模型,着实是有点东西在身上的:

国产的,4K 直出的,开源的,轻量的,还是可以指哪儿改哪儿的。

例如下面这张信息密度超高的图片,就是它做出来的:

我们从结果可以看到,即便是把图片放大了来看 ,不论是文字、图片元素,都是细节拉满的状态。

再如这组充满艺术感的视觉大片,这个 AI 也是不在话下:

那这是何许 AI 是也?

它,便是商汤刚刚面向社区开源的SenseNova U1.5-Lite-Preview

这是一个轻量级原生统一多模态模型的早期预览版本。它延续了商汤自研的NEO-Unify 架构,把语言、视觉语义和像素生成放进同一套模型里,覆盖视觉理解、推理、生成与编辑。

不过有一说一,原生 4K 直出,还仅仅是它的亮点之一。

在仅有 8B-MoT 参数的轻量身形之下,U1.5-Lite-Preview 做到了:

复杂 Prompt 能接住:支持长篇、多约束、层次化和结构化视觉指令;

文字和版式更能打:面向海报、信息图、品牌视觉等高信息密度内容;

生成后还能继续改:支持参考图、多图组合、局部文字编辑,以及红框、坐标和 marker 精准编辑。

毕竟在真实创作中," 会画图 " 只是第一步,真正决定它能不能进入创作流程的,还得看复杂任务和编辑能力。

那 U1.5-Lite-Preview 这个 8B-MoT 小模型创作起来有多方便?我们继续往下看 ~

能 Hold 住复杂创作和编辑才是重点

先来看一张信息密度相当的图片。

这张图的主题是银盐摄影。

画面正中央,是一台被拆解开的复古相机。镜头、快门、胶片仓、卷片轴、取景器等结构,被一层层摊开来讲清楚;一束橙色光线从镜头前方打进来,顺着成像路径一路穿过去,整张图的视觉中心也因此一下子立住了。

这种图最难的地方,其实并不在于 " 画一台相机 " 本身。真正难的是,模型得同时把时间线、知识模块、结构拆解、流程说明和视觉层级都组织进同一张图里,还得让人一眼看过去,知道哪里是主干、哪里是补充,哪里是说明,哪里是结论。

从最后出来的效果看,U1.5-Lite-Preview 在这种高信息密度的信息图任务上,已经能把内容和版式一起接住了。黑白蚀刻风格很统一,主视觉够醒目,细节也足够丰富,整张图读起来并不乱,反而有种 " 越看越有东西 " 的感觉。

如果说上一张图考验的是 " 从零做一张复杂信息图 ",那接下来这组,更像是在考模型有没有复刻一张图的逻辑,再重新输出的能力。

输入图的主题,是一张名为 Modern Pop Culture Film & TV Milestone Journey 的信息图。

它把几部流行影视作品串在一条弯曲的路径上,节点、卡片、插画和标题都带着比较统一的手绘水彩风格。整张图看上去像一张轻松、亲切的文化主题路线图。

而到了输出图,主题换成了 The Journey of Postal Mail,也就是 " 邮政邮件的旅程 "。

但你再仔细看,会发现它并没有推倒重来。

原来那条弯弯曲曲的路径还在,节点式的节奏也还在,左中右的版式关系也保留了下来。只不过,原先围绕电影和剧集展开的内容,被整体替换成了 " 投递、分拣、运输、派送 " 这四个环节。洗衣店、剧集卡片、电影海报式的小模块,被换成了邮筒、分拣中心、运输车、邮差上门这些更贴合新主题的元素。

换句话说,它领悟的并不只是简单的 " 画风 ",更是一整套设计框架和组织方式。

真正的内容生产中,从头做图只占一部分时间;更多时候,折磨人的其实是改稿

比如下面这组博物馆文创的案例:

输入图和输出图,主题其实都是博物馆文创开发流程。

整张图的大框架没有变。左侧仍然是竖排标题,中间依旧是巨大的 "MUSE" 字样,右侧还是从 " 研究与挖掘 " 到 " 反馈与迭代 " 的六步流程,底部的价值模块和整体米色、浅棕色的调性,也都还在。

但它改动的,是画面里最核心的主视觉。这个案例挺像真实工作流里常见的改法。

文案不一定大改,结构也不一定重做,但客户会告诉你,主题方向变了,主视觉要换,气质要跟着调整,原来的信息框架尽量保留。这时候,难点已经不只是 " 生成一张图 ",而是在同一套版式里,重新组织新的视觉主体。

从这个结果来看,U1.5-Lite-Preview 已经开始具备这种能力了。它不是简单地把一件新文物塞进去,而是在保留原有流程信息图框架的前提下,把新的核心元素重新放进整张设计语言里。

我们再来看一个更刁钻的,把有设计感且复杂的 " 迎 " 字,改成 " 命 " 字:

最后的结果里,原有船体继续充当 " 命 " 字的最后一竖,周围浪花则重新组织出其余笔画。而新字依然像是从海面里自然生长出来的,没有变成一层生硬贴上去的平面字体。

除了在一张图上修修改改,U1.5-Lite-Preview 还可以同时读取多张参考图

比如下面这个韩式双拼炸鸡案例:

这次输入的图片有两张,一张参考图负责提供手绘食谱的版式和画风,另一张真实照片负责提供食物内容。

按照要求设计后,输出的图片是这样的:

U1.5-Lite-Preview 把照片中的原味炸鸡、甜辣炸鸡和可乐,重新画进了米色网格笔记本里;左侧黑色螺旋装订、手写标题、卡通小猪,以及下方两行三列的烹饪步骤也一并补齐。

最后做出来的,已经是一张能够直接用于社交媒体传播的手绘食谱。真实照片与插画模板之间,没有出现明显的风格割裂。

类似的能力若是落到办公场景里,U1.5-Lite-Preview 还可以把一张普通人物照片,直接变成一份单栏简历。

从结果来看,人物头像被放在顶部,原图里的三角梅继续作为封面主视觉。玫粉与米白配色顺着花丛延展开来,姓名、职位、联系方式、工作经历和技能条依次排开。

至于我们刚才提到的指哪改哪,红框和 marker 都能派上用场。

最简单的情况下,你可以圈出下面这张信息图里的 "35+MIN",让模型将它改成 "25MIN",同时保持原有字体、字号和排版,并在完成后把用于定位的红框一起移除。

对于复杂一点的要求,则甚至可以直接对画面氛围动手。

原图是一艘帆船驶过金色满月的暖色场景。我们只需要在图上留下 marker 和修改要求,U1.5-Lite-Preview 便会把满月替换成深红色血月,在水面增加一层浓雾,再将天空、湖面与帆船的光线全部调整为暗调夜景。

虽然月亮、雾气和整体光影都变了,但帆船、船上人物与背景树林仍然留在原来的位置。

这一大一小两种修改,刚好对应了编辑场景中的两类需求。

前者追求精准,最好只动几个字符;后者需要模型重新处理色调、光线和空间关系,还得尽量守住画面里的主体。

看到这里,U1.5-Lite-Preview 展现出的不只是会画图这么简单。

它已经开始理解一张图里的主体、版式、风格和空间关系,也开始知道用户想动哪里、哪些地方最好别碰。

怎么做到的?

这些看起来各不相同的能力,其实都顺着同一条技术路线长了出来。

SenseNova U 系列采用的是NEO-Unify 原生统一多模态架构,在同一个模型里,语言、视觉语义与像素生成被放在一起建模。

于是,从读懂指令、分析参考图,到判断该怎么改、最后生成像素,可以在同一套架构中完成。

这套设计放到图像编辑里尤其关键。

比如把 " 迎 " 改成 " 命 ",模型先要理解文字造型是由船和浪花共同组成的,接着找到需要重构的区域,再判断飞鸟、海面和上下方文字应该留下。

血月案例也一样。月亮、雾气和光照需要整体变化,帆船与人物的主体结构则要尽量稳定。

一边动手,一边判断哪里不能乱动,这才有了持续编辑的基础。

为了把分辨率进一步推到 4K,商汤还重新设计了生成头,减弱视觉 Token 网格对最终画面的影响,并把训练扩展到 4K 分辨率。

这样一来,画面放大以后,纹理、材质和光影更经得起看,常见的网格感、拼接痕迹与纹理断裂也会随之减少。

长 Prompt 的控制能力,则由 Prompt Enhance 进一步增强。

日常生图用一句自然语言就能开干。到了海报、信息图和品牌视觉这类复杂任务,用户可以把布局、风格、文字、比例和禁止项逐层写清楚,让模型尽可能同时接住。

所以,长 Prompt 在这里并不会刻意增加使用门槛,它提供的是更高的创作控制上限。

再从评测榜单角度来看,相较上一代 U1,U1.5-Lite-Preview 在Qwen-Image-Bench上的成绩从 47.14 提升至 55.20,这里对应的是 with Prompt Enhance 条件。作为一个轻量级开源模型,表现相当优秀。

与此同时,ImgEdit-Bench 从 3.90 升至 4.37;GEdit-Bench 英文项从 7.47 升至 8.17,中文项也从 7.42 升至 8.05。在技术宣发展示的 WeEdit 榜单中,U1.5-Lite-Preview 的 Overall Average 则达到了 6.44。

有点接近一套视觉工作台了

再回头看这次升级,4K 确实亮眼,却很难独自撑起一套生产流程。

真实的视觉工作,往往从第一版出图之后才开始。

例如标题换一句、产品挪一下、人物得保留、整体光线再暗一点、客户临时又要补个元素……

过去我们遇到这些修改,要么重新生成碰运气,要么回到专业软件里继续处理。

但当模型能够理解眼前这张图,并顺着用户的反馈一轮轮往下改,AI 生图才开始真正靠近内容生产和设计工作流。

而统一多模态架构的价值,也在这个过程中变得更容易感知。

视觉理解、推理、生成和编辑不再分别躺在技术说明里,它们最终落成了看懂参考图、保住人物、换掉标题、重排版式和局部修改这些具体动作。

当然,U1.5-Lite-Preview 依然只是一个早期预览版本。短 Prompt 理解、小字与人像细节、整体美学一致性,以及复杂场景编辑的稳定程度,都还有继续提升的空间。

据了解,U1.5 的正式版很快就会开源;届时,这些问题应当都会得到很好的解决。现在,商汤把轻量版面向社区开源,也意味着这些能力和问题,都将更早进入开发者与创作者的真实工作流里接受检验。

总而言之,若是说 4K 决定了一张图能放多大,那么 AI 的理解和编辑能力,则决定它能走多远。

开源地址:

GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md

Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview

魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 商汤 ai 艺术
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论