第一新声 21小时前
7B参数拿下开源第一,千问Qwen-Image-2.1把AI生图的“最后一公里”打通了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

分析师/智涵

校对/Tina

策划/Eason

对设计师来说,AI生图一直有一个尴尬的现实:生成一张漂亮的图很容易,但把这张图用到实际工作里,还差好几步。

人物要抠图、素材要改字、商品的摆放要反复调整,但包装上的字、瓶身的形状不能跟着变。如果客户说"再改一版",你得从头来一遍。更别提中文内容—— AI 生成的中文招牌、广告牌、产品包装上的文字,十有八九是乱码。

这些细节决定了AI生图能不能真正进入创作流程。而图像模型当下的核心瓶颈,恰恰在于每一次修改指令能否被准确完成。

9月20日,阿里千问正式开源图片生成模型Qwen-Image-2.1。视觉生成部分仅有7B参数,却把文生图、图像编辑、原生透明图生成整合进了同一个模型。在Qwen-Image-Bench公开评测中,它以60.28分登顶开源模型第一,超过了Nano Banana 2.0的59.82分和GPT Image 1.5的59.65分。

一个7B参数的模型,凭什么跟闭源大模型同场竞争?开源阵营的这步棋,又在行业里撕开了多大的口子?

7B参数"以小博大":

不只是画得好,更是"改得动"

要理解Qwen-Image-2.1为什么值得关注,得先看它在能力上做对了什么。

首先,它把"生成"和"编辑"合进了同一个模型。 过去的图像模型要么只会画图,要么只会改图,透明图层还得单独跑一套抠图工具。Qwen-Image-2.1把文生图与图像编辑统一在同一条管线里,用32层Single-Stream DiT架构、7B参数的视觉生成模块实现了这一点。这意味着你不再需要在"生图模型"和"修图模型"之间来回切换。

其次,它在推理效率上做了关键优化。 核心思路是减少不必要的重复计算。在一次图像编辑中,输入的参考图和编辑指令不会随着每一步生成而改变。新模型采用混合粒度注意力结构——文本部分走Token级因果掩码,图像生成部分走Chunk级掩码,并通过KV Cache机制在首步计算后缓存静态上下文,供后续生成步骤复用。翻译成人话就是:AI会先处理好参考材料,在逐步生成目标图片时重复利用已有结果。这项优化在多图输入时效果尤为明显,而Qwen-Image-2.1最多支持10张参考图输入,这种优化就显得至关重要。

第三,原生透明图生成是这次最贴近设计需求的能力。 常规图片素材带有完整背景,要把主体用到海报或商品详情页里,往往需要先抠图。Qwen-Image-2.1可以依据提示词自动决定生成普通图片还是透明图,直接输出带Alpha通道的RGBA素材。这对于电商主图、贴纸、图标、游戏资产来说,比单纯追求画质更像生产力。而且透明图生成之后还能继续修改——调整表情、替换文字,甚至从真实照片中提取主体输出透明图层。

第四,人像与商品保真能力显著增强。 换了发型或场景,人像仍保有原来的身份特征;商品换了摆放环境,包装文字、纹理和形状也尽可能一致。模型重点提升了面部细节还原能力,以及商品在新场景中的文字、纹理与形态一致性。对广告和电商场景来说,这是"能不能交稿"和"要不要返工"的分界线。

这四个能力组合在一起,让Qwen-Image-2.1覆盖了从素材生成、组合到修改的完整工作流。它不再是一个"抽卡工具",而是一个可以反复修改的生产力工具。

开源 vs 闭源:

两条路线的对撞,已经开始了

Qwen-Image-2.1的发布,最有意思的不是它自己有多强,而是它代表的开源路线正在跟闭源路线正面交锋。

一方面,闭源阵营的优势是"打开就能用"。 GPT-Image 2.5继续走ChatGPT与API的现成服务路线,OpenAI把它拆成了更快的Flare和更强调精细创作的Sunburst,用户不需要准备任何环境就能出图。对于只想尽快做一张公众号封面或活动海报的人来说,这种省事本身就是价值。

另一方面,Qwen-Image-2.1争取的是"控制权"。 权重开放后,有技术能力的团队可以决定模型放在哪里跑、如何批量调用、怎样和内部素材库组合。固定品牌风格、多图协作、数据与流程控制——这些都是"打开就能用"的服务模式给不了的东西。

两条路线不会立刻互相替代,但它们正在把行业从"偶尔出一张神图"逼向"稳定交付一批可用图"。

还有一个被很多人忽略的差异点:中文能力。 目前主流的图片模型大多来自国外,对中文的支持一直是短板。在短剧、广告、电商等场景中,中文文字几乎不可避免,而国外模型生成的中文经常出现乱码,而且这个问题会在后续图生视频的环节被进一步放大。Qwen-Image-2.1在文字渲染上做了针对性提升,不仅关注内容准确性,也注重字体、排版与画面的整体协调。这对中文创作者来说,是一个实打实的体验差距。

当然,路线选择也意味着取舍。开源模型不是零成本的——显卡、存储、部署和维护都是真成本。而且Qwen-Image-2.1采用的是Qwen Research License,商用需要另行申请许可。"权重可下载"和"可以随意商用"是两件事,这一点需要提前想清楚。

但方向已经很清楚了:闭源守住的是低门槛,开源争取的是控制权。 两条路线并行,反而会加速整个行业从"模型竞赛"转向"工作流竞赛"。

行业分水岭已至:

AI生图正在从"抽卡"走向"干活"

Qwen-Image-2.1的发布,折射出的不只是一个产品的迭代,而是整个AI生图赛道正在经历的三个深层变化。

第一,从"成品竞争"走向"生产权竞争"。 过去我们评AI生图,常拿两张成品摆在一起看谁更精致。但一旦进入真实生产,这种比较很快失效——一张样片再漂亮,不能稳定复现、不能批量接入、改一个地方却带崩全图,最后还是要靠人返工。Qwen-Image-2.1把生成、编辑、透明图层、多图参考放进同一个开源模型,意味着创作者不只是"用上一个好模型",而是可以真正拥有一个能接入自己流程的生产工具。

第二,从"画质内卷"走向"流程内卷"。 图像模型正在覆盖创作流程中越来越多的细化环节。透明素材的输出、多图参考的合成、局部编辑的精准度、人像与商品的保真——这些都增加了AI模型进入实际工作流程的可能性。当这些能力被封装进更多现成工具和工作流,从想法到视觉作品的门槛会再次大幅降低。对创作者而言,意味着更多素材制作和调整工作可以通过更简单的方式完成;对开发者来说,新模型开源为构建设计工具、应用和定制工作流提供了新的基础。

第三,中文场景的"最后一公里"正在被打通。 对于做短剧、广告、电商的团队来说,一个绕不开的现实是:素材上的中文不能出错。国外模型的中文渲染一直是弱项,导致图像工作流无法完全依赖AI完成。Qwen-Image-2.1在这方面的提升,让纯开源AI视频工作流有了真正的可行性——从场景图生成到中文优化再到视频输出,整条链路可以跑通,不再需要在多个工具之间来回搬运。

当然,挑战同样存在。评测榜单是厂商自建的Qwen-Image-Bench,与GPT Image 2.5 Sunburst的67.01分相比仍有差距。模型的实际表现,最终还得拿你自己的提示词出图来说话。

写在最后

回头看AI生图的第一阶段,平台卖的是"惊喜":输入一句话,机器第一次给你一张像样的图。第二阶段比的是"稳定":文字能不能写对、人物能不能保持、局部修改会不会牵一发动全身。

Qwen-Image-2.1正式开源,又把竞争往前推了一步。当模型可以下载、部署和接进自己的素材库,创作者开始关心的不只是"这张图好不好看",而是"这套能力能不能变成我长期拥有的生产工具"。

7B参数拿下开源第一,说明了一件事:在图像生成领域,参数规模不再是唯一壁垒,工程能力和场景理解正在成为新的分水岭。

开源不是答案,它是问题的开始。真正值得期待的,是社区基于这个模型会造出什么样的工具和工作流——那才是决定AI生图能不能从"玩具"变成"工具"的关键。

转载、采访报道:Tina(微信:beijingyh1992)

榜单、市场合作:小新(微信:dyxsmxx)

内容合作:Kim(微信:beijingkim2020)

会员合作:Sherry(微信:sherry_199909)

视频合作:Rita(微信:qyqx20220202)

更多内容

【人工智能】3.45亿 VS 1.66亿:豆包逼急阿里,千问携40亿淘宝商品库打响"AI购物第一枪" |一觉醒来,马斯克亲手解散xAI!22万张GPU全给Claude,AI战局一夜改写|68元起,豆包迈向收费第一步:免费的"代价",终于兜不住了|Anthropic"连坐"封号、Cursor 9秒删库:AI反噬企业的惨痛一课,代价太贵了|阿里"快乐小马"开启灰度测试:用原生音画定义AI视频的下半场 |每秒10米、无头无手、重心贴地:宇树H1如何让机器人"飞"起来? | 腾讯扔出一只浏览器"龙虾",浏览器赛道迎来最强搅局者"太危险了,不敢公开发布":Claude Mythos为何让硅谷巨头集体恐慌字节、阿里、腾讯的AI工业化暗战:谁在建造AI时代的"工厂"?从工具到生态:银联APOP框架发布,勾勒智能体支付新蓝图日均120万亿Token,中国大模型终于跑出一个"全球第三"Claude Code"被开源":一场51万行代码的意外漂流,正在加速AI开发者的竞赛|没等来V4,等来大升级?Deepseek宕机一夜,是重大事故还是偷偷变强|从偏科生到"人形第一股":王兴兴的十年逆袭|亲手砍掉Sora,奥特曼在下一盘什么棋?|龙抬头,向AI"抬头":一部AI短剧如何"捅破"传统广告的天花板|Token经济:谁在瓜分"小龙虾"带来的万亿红利?|谷歌AI Studio深夜放大招:全栈Vibe编码体验上线,一句话开发原生应用

【行业深度】具身智能"爆发",谁将是背后的"投资之王"? | AI会革了百度的命吗? | 真假混战:Agent元年,如何拨开概念迷雾?没找到刚需:人形机器人是个好生意吗 | 用得起来 还有"人样" 2025世界机器人大会人满为患 | 2025年WAIC:一票难求,800厂商从"概念"走向"落地" | AI浪潮下,数据库如何"进化"?AI Agent是中国SaaS的解药 | 央国企的AI征途:抢跑还是稳行?出走大厂的95后CEO们,已在AI赛道融资数亿这波AI风口,让青年投资人踩中了深圳实验创投"群英谱":一所中小学的"硬核"造星之路

【人物周刊】中台化架构+场景化落地:迈富时如何用AI-Agentforce构建企业"智能业务闭环"?|行业困于"伪智能",原力无限以VLA与世界模型双线破局|从技术先锋到生态构建者,贝锐CEO讲述19年"连接革命"与"软硬一体"突围之路 一群清华人,与具身智能的四十年 | 用AI Agent征战海外市场Agent让营销从"人找货"变"货追人" | 专访白惠源:撕掉"阿里副总裁"标签,数亿资金押注"下一代AI"姚期智和他的"姚班":人生只为一大事而来 | 朱啸虎:萧条时代下的迷途猎手雷军和他的"小米哲学":把风口玩到next level

【行业研究】《2025年中国企业级AI Agent应用实践研究报告》 《2025年中国金融业数据库国产替代能力评估报告》《大模型时代 2025年央国企数智化转型新实践与新范式》《2025年中国IT后市场发展研究报告》《2024年央国企RPA市场研究报告》《2024年中国AI大模型产业发展与应用研究报告》《2024年中国银行业数据库市场研究报告》《2024年中国CRM市场研究报告》《2024年中国智能客服市场研究报告》《2024年中国网络靶场市场研究报告》《2024年中国交通运输行业数字孪生市场研究报告》

关注「第一新声」并设置星标,第一时间GET行业信息

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 阿里 开源 准确
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论