AAAC4D 昨天
通义千问开源新多模态:30亿参数打赢GPT-5-Mini
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

通义千问开源新多模态:30 亿参数打赢 GPT-5-Mini

10 月 4 日,阿里云通义千问团队干了件让整个开源圈沸腾的事:一口气开源了 Qwen3-VL-30B-A3B-Instruct 和 Qwen3-VL-30B-A3B-Thinking 两款多模态模型,还贴心地提供了 FP8 版本。同时上线的,还有更大杯的 Qwen3-VL-235B-A22B FP8 版本。

先说结论:这次开源的 30B 小钢炮,官方给出的成绩单相当炸裂——在 STEM、视觉问答(VQA)、OCR、视频理解、智能体(Agent)这些硬核任务上,直接对标 GPT-5-Mini 和 Claude 4-Sonnet,部分项目表现还要更优。

什么是 A3B?30 亿激活参数的门道

先拆解一下这个有点绕的名字:Qwen3-VL-30B-A3B。

后面的 A3B,指的是 " 激活参数约 30 亿 "。也就是说,这个模型总参数量约 30B,但每次推理时真正 " 上岗干活 " 的参数,只有 30 亿左右。

这是典型的 MoE(混合专家)架构。你可以把它想象成一家大公司:全公司有 3 万名员工(总参数),但每个具体项目,只需要抽调 3000 名最合适的专家来干活(激活参数),其余人继续待命。

这种架构带来的好处非常直接:显存占用和推理速度,接近一个小得多的稠密模型,但能力上限却保留了 30B 级别的储备。翻译成人话就是——用小模型的成本,跑大模型的效果。

对于想在本地或者私有环境部署多模态能力的团队来说,这正是最渴望的组合。

小钢炮对标旗舰?官方成绩单来了

根据官方说法,Qwen3-VL-30B-A3B 在 STEM(数理化逻辑推理)、视觉问答、OCR 文字识别、视频理解、Agent 智能体任务这五大方向上,能力媲美 GPT-5-Mini 和 Claude 4-Sonnet,部分任务表现更优。

这五个方向,恰好是当下多模态应用最核心的战场:

- OCR:文档数字化、票据识别、截图取字的刚需场景;

- 视频理解:短视频时代的流量密码,谁能看懂视频谁就掌握内容生产主动权;

- Agent:让模型不只 " 看懂 ",还要能 " 动手 ",是 2026 年公认的主旋律;

- STEM 与 VQA:教育、科研、工业质检等高价值场景的入场券。

一款激活参数只有 30 亿的模型,能在这些任务上跟闭源旗舰掰手腕,这件事本身,比任何一个单项分数都更有信号意义。

Thinking 版本:会 " 想 " 的视觉模型

这次同步开源的 Thinking 版本,是理解这波发布的关键。

Instruct 版本是 " 有问必答 " 的执行者,而 Thinking 版本则具备更深入的推理过程——遇到复杂的视觉推理题、多步骤任务规划,它会先 " 想 " 再 " 答 "。这在需要高可靠性的场景里,比如代码截图分析、数学图形题、跨图逻辑推理,价值巨大。

两款一起放出来,等于给了开发者一个从 " 快 " 到 " 准 " 的选项区间,按需取用。

FP8 上桌:把部署成本再砍一刀

别忘了,这次还同步放出了 Qwen3-VL-235B-A22B 的 FP8 版本。

FP8 是一种低精度数值格式,相比传统 FP16,模型体积接近减半,显存需求大幅下降,推理吞吐还能往上提。对于动辄上百 B 参数的旗舰模型来说,FP8 版本意味着更多消费级和准专业级显卡也能摸到旗舰能力的门槛。

而 30B-A3B 的 FP8 版本,则把 " 本地跑一个视觉智能体 " 的门槛,压到了前所未有的低点。

为什么说这步棋很精明?

回到定位本身。阿里这次开源的核心逻辑,不是在闭源榜单上卷名次,而是以开源生态扩大产业落地。

想想看:闭源模型按 token 收费,用得越多花得越多;开源模型部署在自己服务器上,边际成本趋近于零。当一款开源模型的能力逼近闭源旗舰,大量对成本敏感、对数据安全敏感的企业,会毫不犹豫地转向开源方案。

多模态恰恰是落地的甜点区——文档处理、视频审核、智能客服、工业视觉,全是企业真金白银愿意买单的场景。把最强的开源多模态模型握在手里,等于把这些场景的生态入口握在手里。

而且从 Instruct 到 Thinking、从 30B 到 235B、从 BF16 到 FP8,产品矩阵一次性铺满,开发者各取所需,社区自然滚雪球。

30 亿激活参数,敢叫板 GPT-5-Mini 和 Claude 4-Sonnet,这背后是 MoE 架构红利、开源策略和产业判断的三重合力。

大模型之战打到 2026 年,拼的已经不只是谁最强,还有谁能用最低的成本,让最多的开发者和企业用起来。

开源多模态这盘棋,通义千问又落了一手大棋。

你觉得开源模型多久能全面追平闭源旗舰?是时候押注本地部署了吗?评论区聊聊你的看法——

如果觉得内容有用,欢迎点赞、转发给身边正在折腾 AI 的朋友,关注我,第一时间获取大模型开源圈的一手消息。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论