雷锋网 23小时前
原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线:在单一模型中联合建模语言、视觉语义与像素生成,让模型能够原生完成视觉理解、推理和生成。

过去几个月中,我们持续强化模型的图像生成与编辑能力,现面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。SenseNova U1.5-Lite-Preview 并非简单的模型规模升级,而是基于 U1 的一次系统性迭代,不仅在同一架构中贯通视觉理解、推理、生成与编辑,还仅以 8B-MoT 的轻量大小,将能力推进到 4K、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。                            

SenseNova U1.5-Lite-Preview 生成

相比 U1,U1.5-Lite-Preview 在以下方向上带来了显著提升:

▪ 原生支持4K 图像生成;

▪   更精细的局部纹理、细节与真实世界质感

▪   更准确的中英文文字生成与复杂版式组织

▪   更稳定的图像编辑视觉指令遵循

如果说 U1 成功验证了 " 统一架构是否可行 ",证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线,那么U1.5 将进一步验证 " 能力能否持续扩展 ",证明统一架构不仅能够同时承载理解和生成,也能够继续扩展到更高分辨率、更复杂的信息表达和更真实的视觉世界。

我们相信,未来的多模态模型不应只是连接不同模态的系统,而应该是一个从一开始就能够跨越语言、视觉与行动进行学习、思考和创造的统一智能体。

长上下文视觉控制:模型能力与创作辅助的协同

U1.5-Lite-Preview 在生成能力上做了系统性打磨,我们追求的不仅仅只是 4K 高像素,更关注的是:模型能否理解超长的自然语言和结构化视觉指令,从而实现精准的视觉控制;超大画幅下细节是否经得起放大、并保持足够的真实世界质感;信息密集的内容里文字和版式是否足够稳定。

更高的视觉控制上限:写得越细,出图越准

在海报、信息图、品牌视觉等更复杂的创作任务中,一张图往往需要同时满足多类要求:画面中有哪些主体、人物与物体如何互动、各元素位于什么位置、采用怎样的视觉风格、呈现哪些文字,以及哪些内容必须保持或避免。

U1.5-Lite-Preview 重点优化了对长篇自然语言、结构化创作指令的理解能力。简单的需求,用户用几句大白话就能快速生成;复杂的任务,则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。在我们看来,超长的提示词并不是生成好图的必要条件,它的价值是给复杂创作提供了更高的控制上限。

下面这张 " 背包产品解析 " 信息图使用了 1675 词的超长 prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。

一个重要观察是,U1.5-Lite-Preview 的强 prompt following 能力,并非主要来自对结构化模板的记忆或适配。即使在没有高度依赖专门 Prompt Enhance 格式化数据训练的情况下,模型依然能够较稳定地执行长篇、多约束、层次化的视觉指令。我们认为,这正体现了原生统一多模态路线的优势:模型学到的不是某种 Prompt 格式本身,而是从语言描述到视觉结构的原生映射能力。

为了降低复杂视觉指令的编写门槛,我们还配套了实验性的Prompt Enhance Skill:它能把用户简短的想法,自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案,再交给模型执行,帮助用户把需求表达得更周全,减少因为描述有遗漏导致效果偏差的情况。

原生 4K 生成:超大画幅下,细节依然经得起放大

4K 不只是像素更多,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷与高细节视觉内容,U1.5-Lite-Preview 都能呈现真实的材质质感与光影层次。

下面的案例中,模型生成了横跨 2018 至 2026 年的 WAIC 发展历程长卷。

WAIC 发展历程(分辨率 4K,长宽比 10:3,prompt 总长 3880 words)

这幅长卷以传统中国山水长卷的散点透视和连续叙事方式,将上海城市、智慧交通、云计算、智能工厂、大模型、生成式人工智能、具身机器人、智能体和未来城市融合在同一片山河之中。即便放大观看,大量文字、图标等设计细节依然清晰稳定。

除了超大画幅,U1.5-Lite-Preview 在常规图像的真实感与细节表现上也有明显提升:

海岸游客中心建筑概念图

   

文字生成与版式升级:信息量再大,效果也稳得住

U1.5-Lite-Preview 强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略,到复杂信息图,都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。

编辑能力进化:告别单次抽卡,哪里不对改哪里

图像编辑并非简单的局部像素重绘,它要求模型能看懂画面内容、理解用户的真实意图,精准判断出 " 哪里要改、怎么改,以及哪些部分绝对不能动 "。

依托原生统一多模态架构,U1.5-Lite-Preview 不需要拼接多个独立模型,在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了 encoder-free 视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈,将文字笔画、局部纹理、空间结构等精细信息保留得更加完整,进一步提升了编辑的准确度、画面稳定性和可控性。

U1.5-Lite-Preview 让图像编辑不再是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。这使图像创作从一次性的 " 重新采样 ",转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从 " 一次抽卡、不行重来 " 变成 " 反复修改、改到满意 "。

目前,U1.5-Lite-Preview 已覆盖多类主流创作工作流

参考图风格与设计再创作:看懂一种风格,迁移到任何主题

可理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。

多参考图组合编辑:跨图取要素,融合成新作

可从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。

单参考图条件创作:以一张图为基础,完成完整视觉设计

能够以单张人物、产品或场景图片作为视觉条件,在保持主体身份、外观和关键细节的基础上,生成新的海报、信息图、营销页面或其他设计内容。

案例:人物照片简历排版

信息图局部编辑:牵一发,不动全身

可针对信息图中的标题、数字、图标、标注、图表及内容模块进行定向修改,支持元素增删、位置调整、局部美化和瑕疵修复。

文字编辑:文字改了,风格还在

可对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。

交互式精准编辑:画个框,告诉模型 " 改这里 "

支持区域标记、坐标定位、marker 标记等方式让模型更准确地理解编辑位置与范围,可对局部属性进行调整。

基于 U1 的系统性迭代:从验证架构可行,到真实场景好用

U1 成功验证了原生统一多模态架构的可行性,而在实际落地与社区反馈中,我们也看到了这条技术路线仍有可优化的真实场景痛点:

▪   在生成场景下,U1 在不同区域之间有时会衔接得不够自然,出现细微的网格感、拼接痕迹或纹理断裂;而当生成分辨率继续提升时,模型对局部细节、复杂空间关系和整体画面一致性的建模难度也会进一步增加。

▪   在图像编辑任务中,U1 已经能够理解自然语言编辑指令,但在更复杂的实际工作流中,仍可能出现编辑范围外内容发生变化、人物身份或主体结构漂移、局部修改影响整体画面等问题。

U1.5-Lite-Preview 致力于针对性解决这些真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:

▪   针对网格伪影和高分辨率细节建模问题,U1.5-Lite-Preview 重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练进一步扩展至 4K 分辨率。

▪   针对图像编辑,U1.5-Lite-Preview 重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力,使其能够在完成目标修改的同时,尽可能保留原图中不需要改变的部分。

得益于多项能力强化,U1.5-Lite-Preview 在多项主流生成 / 编辑质量评测基准上显著超越 U1,并以仅 8B-MoT 的轻量级规模,实现了可比肩商用闭源模型的图像生成能力与编辑效果:

▪   Qwen-Image-Bench 从 47.14 提升到了 55.20(with Prompt Enhance)

▪   ImgEdit-Bench 从 3.90 提升到 4.37

▪   GEdit-Bench-en 从 7.47 提升到 8.17

▪   GEdit-Bench-zh 从 7.42 提升到 8.05

SenseNova U1.5-Lite-Preview 现面向全球用户开源,欢迎广大开发者与创作者下载体验,提供反馈和建议。

▪   GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md

▪   Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview

▪    魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview

从 U1 到 U1.5 的开源,代表了商汤在底层创新上的持续进展。同时,面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。

关于商汤

作为人工智能软件公司,商汤科技以 " 坚持原创,让 AI 引领人类进步 " 为使命,旨在持续引领人工智能前沿研究,持续打造更具拓展性更普惠的人工智能软件平台,推动经济、社会和人类的发展,并持续吸引及培养顶尖人才,共同塑造未来。

商汤科技拥有深厚的学术积累,并长期投入于原创技术研究,不断增强行业领先的多模态、多任务通用人工智能能力,涵盖感知智能、自然语言处理、决策智能、智能内容生成等关键技术领域,同时包含 AI 芯片、AI 传感器及 AI 算力基础设施在内的关键能力。

商汤科技业务涵盖生成式 AI、视觉 AI 和创新业务,以高效率、低成本、规模化的 AI 创新和落地,打通商业价值闭环,引领人工智能进入工业化发展阶段。商汤前瞻性打造新型人工智能基础设施——商汤 AI 大装置 SenseCore,打通算力、算法和平台,并在此基础上建立 " 商汤日日新 SenseNova" 大模型及研发体系,以低成本解锁通用人工智能任务的能力。此外,商汤科技持续领跑计算机视觉市场,商汤方舟 SenseFoundry 以多年积累计算机视觉能力,辅以前沿多模态大模型,为国内外各行业提供更加稳定高效的视觉 Al 支撑。

商汤倡导 " 发展 " 的人工智能伦理观,并积极参与有关数据安全、隐私保护、人工智能伦理道德和可持续人工智能的行业、国家及国际标准的制订,与多个国内及多边机构就人工智能的可持续及伦理发展开展了密切合作。商汤《AI 可持续发展道德准则》被联合国人工智能战略资源指南选录,并于 2021 年 6 月发表,是亚洲唯一获此殊荣的人工智能公司。

目前,商汤科技已于香港交易所主板挂牌上市。商汤在香港、上海、北京、深圳、成都、杭州、西安、新加坡、曼谷、吉隆坡、利雅得、阿布扎比、迪拜、首尔等地设立办公室。另外,商汤科技在德国、泰国、印度尼西亚、菲律宾等国家均有业务。更多信息,请访问商汤科技网站、微信、微博和领英。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 分辨率 准确 商汤科技
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论