驱动之家 昨天
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 21 日消息,阿里千问正式开源新一代图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中。

视觉生成部分仅 7B 参数,却在 Qwen-Image-Bench 公开评测中拿下 60.28 总分登顶开源第一,甚至超过闭源的 Nano Banana 2.0(59.82)和 GPT Image 1.5(59.65),官方将其定位为千问图像系列当前 " 最平衡、性价比最高 " 的开源生图模型。

视觉生成部分采用 32 层 Single-Stream DiT,原生支持 2K 分辨率输出,整个管线(含 Qwen3-VL 8B 文本编码器)总参数量约 16.22B。

推理侧引入混合粒度注意力结构:文本部分(系统前缀、编辑指令)走 Token 级因果掩码,图像生成部分走 Chunk 级掩码,配合 KV Cache 复用机制将输入图像与编辑指令作为静态上下文在首步预计算缓存。

多图输入场景下的效率提升尤为明显,兼顾了推理速度与显存开销。

原生 RGBA 透明图是本次更新最具实用价值的能力,模型可根据提示词自动决定输出普通图像还是带透明通道的图像,无需额外的抠图环节。

这项能力吸收了 2025 年 12 月发布的 Qwen-Image-Layered 专用模型,并进一步扩展——不仅能生成单个主体的透明素材,也能生成多元素组合的复杂结构图像;透明图层中的文字、人物表情均可直接编辑。

输入一张 RGB 真实照片,模型可提取主体输出带 Alpha 通道的 RGBA 图层,毛发边缘这类传统抠图痛点从根源上被绕开。

编辑能力有四个维度升级,参考图上限提升到 10 张,可将多张人像合成合照,也可输入模特 + 衣服 + 鞋子 + 包包 + 帽子共 5 张图生成完整穿搭,还能参考 10 张家装图输出室内布置方案;局部编辑支持圈选、涂抹和独立掩码三种方式,一次指定多个区域分别修改,掩码方式可完整保留原图信息。

人像与商品保真增强,修图前后面部特征保持高度一致,商品在新场景中文字、纹理与形态不走样;同时覆盖全景图、信息图、分镜图等多种任务类型。

文字生成除内容准确外,更注重字体、排版与画面的整体协调;人物表现上强化光影与细节刻画,让生成结果更接近真实质感。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:建嘉

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 分辨率 准确 阿里
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论