IT 时代网 8 月 5 日消息,商汤科技面向社区开源了轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。这不是简单的参数扩容,而是在今年 4 月发布的 SenseNova U1 基础上做的一次系统性迭代。
回看 U1 的路线:它基于 NEO-Unify 架构,在单一模型中联合建模语言、视觉语义与像素生成,让模型原生完成视觉理解、推理和生成三件事。U1 要回答的问题是统一架构可不可行,而 U1.5 想验证的是另一个问题——这套架构的能力能不能持续扩展。
新版本只有 8B-MoT 的体量,却把几项能力往前推了一截:原生支持 4K 图像生成,局部纹理与真实质感更细腻,中英文文字生成和复杂版式组织更准确,图像编辑与视觉指令遵循也更稳定。
在生成侧,官方强调的重点并非单纯堆像素。模型能否读懂超长的自然语言与结构化视觉指令,从而实现精准控制;超大画幅下细节放大后是否经得起看;信息密集的画面里文字和版式稳不稳——这三点才是打磨方向。
一个具体例子是背包产品解析信息图,提示词长达 1675 词,包含复古博物学图鉴风格、五章结构、中英双语对照、拉丁文标注等一连串约束,模型能按层次逐条执行下来。研发团队观察到,这种长指令遵循能力并非来自对模板格式的记忆——即便没有大量依赖专门格式化数据训练,模型依然能稳定处理长篇多约束的视觉指令。在他们看来,这体现了原生统一路线的优势:学到的是从语言描述到视觉结构的映射,而不是某种提示词格式本身。
为降低复杂指令的编写门槛,团队还配了一个实验性的提示词增强工具,能把用户几句大白话整理成包含主体、布局、风格、文字与各项约束的完整方案,再交给模型执行。
4K 生成方面,官方放出的案例包括一幅横跨 2018 至 2026 年的世界人工智能大会发展历程长卷,分辨率 4K、长宽比 10:3,提示词总长 3880 词。这幅长卷用传统山水长卷的散点透视和连续叙事方式,把城市、智慧交通、云计算、智能工厂、大模型、具身机器人等元素融进同一片山河,放大之后大量文字与图标细节依然清晰。
编辑能力的变化同样值得留意。图像编辑不是局部像素重绘那么简单,模型得看懂画面、理解意图,判断哪里要改、怎么改、哪些部分绝对不能动。依托统一架构,U1.5-Lite-Preview 不需要拼接多个独立模型,在同一个模型内完成视觉理解、目标定位、约束推理与像素生成的全流程。它采用 encoder-free 的视觉建模方式,减少固定视觉编码器带来的信息压缩,把文字笔画、局部纹理、空间结构这些精细信息保留得更完整。
带来的直接变化是,图像创作从一次抽卡、不行重来,变成了可持续迭代的操作过程——在当前结果基础上继续改文案、调版式、补元素,哪里不对改哪里。
注:本文中包含 AI 辅助创作的内容。


登录后才可以发布评论哦
打开小程序可以发布评论哦