狂喜~开发者苦等已久的 Qwen3.8-27B 终于开!源!了!
270 亿的总参数量,在官方 Benchmark 多项软件工程和 Agent 评测中的表现吧,多少又有点让 Claude《危》了——
Agent 编程评测 SWE-bench Pro 上,27B 以 8.3 分的优势卷超 Claude Opus 4.6 Max。
到了更考验真实软件工程能力的 QwenSWEBench,甚至领先幅度进一步扩大到 15.2 分:

尺寸虽小,参数配置和模型表现配的可不孬——
原生多模态、262K 原生上下文、最高 100 万 Token 扩展,重点强化的 Coding、专业工作和长程 Agent 能力,也一项没落下。
好东西大家自然都想尝鲜一番!!
这不嘛,已经有一大波网友开始大 roll 特 roll 了。
下面这老哥用 3.8-27B 和 3.6-27B 分别做了个像素风宝塔效果,3.8-27B 在色彩细节和主体结构明显更 next level~

还有网友用 Qwen3.8-27B 做的俄罗斯方块——
甚至连空格键掉落时的屏幕抖动、消除行时出现的奖励倍增器效果也都是模型自己添加的:

甚至还有网友说:好啊好啊,那这意思是,差不多咱以后可以在本地跑「Opus 级」模型了!?

Qwen 这模型,多少还是有点说法的。。。
270 亿参数,代码和 Agent 多项榜单超过 Opus 4.6 Max
Qwen3.8 这一代,说实话最近上新速度属实有点快。。。
而且这只 27B,开发者友友们其实已经蹲挺久了。
正式开源之前社区里的《催更》就没怎么停过,也有不少人直接把它列进这一轮 Qwen3.8 里最值得等的开源版本。
大家之所以这么惦记,一个特别现实的原因就是——这回,自家电脑真有机会带得动了。(doge)
毕竟——总参数量就「270 亿」。
换句话说,经过量化之后 24GB 显存的 RTX 3090、4090 这类显卡,都有机会把模型整卡装下~

尺寸下来了,上下文长度倒是一点没跟着缩水,原生支持 262K Token 上下文,还可以继续扩展到 100 万 Token。
具体到干活场景,这一代 27B 重点强化的方向也很明确:
编程、专业工作、研究以及长程 Agent 任务,基本都是现在开发者最常拿模型狠狠干活的地方。
但!这里我特别想单独拎出来说一个能力——
「原生多模态」。
需要给友友们划个重点,Qwen3.8-27B 本身就带视觉理解和解析能力。
意思就是,它除了读文字、啃代码,还能直接看图片、读 PDF 文档、理解图表,甚至处理视频!!!(欢呼 .jpg)

尺寸够小,能往本地塞,上下文够长,能吃大工程,多模态和 Agent 能力又都保留了。
至于这些本事到底练到什么程度,官方榜单已经给出了一波答案。
咱们先从最适合拿来干活的两项看——代码和 Agent。
在编程评测 SWE-bench Pro 里,Qwen3.8-27B 比 Claude Opus 4.6 Max 高出 8.3 分;到了软件工程评测 QwenSWEBench,领先幅度进一步拉到 15.2 分。
Agent 评测中面向计算机、金融、法律、医疗等专业长任务的 CoWorkBench 达到 70.7 分,也超过 Opus 4.6 Max 的 68.2 的成绩——

再看多模态能力这边,模型能力提升表现甚至更集中。
在电脑操作评测 OSWorld-Verified 中,Qwen3.8-27B 拿到 84.3 分,Opus 4.6 Max 是 72.7。(给到 Claude 一个拉!)
手机操作评测 AndroidWorld 中,Qwen3.8-27B 达到 81.9 分,Opus 4.6 Max 是 62.0,浏览器操作 WebArena-Verified,则从上一代的 48.8 提升到了 64.8 ——

通用多模态智能这边,也有几项维度我们可以一起看一下。
在视觉数学问题解决能力上,开启 CI 后,Qwen3.8-27B 拿到 94.6 分,是图里这一排可见模型中的最高成绩,这类任务不只是识别图片里的字,还得把图形、公式、空间关系一起理解。
在通用视觉推理方面,Qwen3.8-27B 开启 CI 后做到 85.6 分,相比不开 CI 时的 65.7 提升非常明显,它更偏向考模型面对普通视觉场景时,能不能从「看见东西」进一步走到「理解关系、做判断」。
这成绩也说明这代 27B 模型在看图、读文档和视觉推理这些任务上,模型覆盖的场景和性能表现更多更强~

好东西大家自然要一试,这不嘛,各方网友大神已经开始集体研究「这小 27B 模型到底该怎么跑」了。(doge)
比如下面这位友友用 Qwen3.8-27B 做了一个贪吃蛇游戏后,直言感觉像拥有了一个 Opus 级别的 Agent ——

还有网友直接把 Qwen3.8-27B-FP8 放到一张 NVIDIA GH200 上实测,同时跑 10 个真实请求,每个最高输出 16K Token、上下文拉到 262K。
结果首批流式 Token 基本都在 10ms 内返回,10 个请求也全部正常完成,高并发和长上下文下的运行稳定性确实夯:

还有网友直言模型的多模态理解能力也非常不错。
一次性丢给它一部 1935 年的 11 分钟电影,让模型识别其中 96 个带时间戳的事件并逐字引用画面文字。
最终 157 秒完成,时间点对应到具体画面时,整部片子的误差大约只有 2 秒,而且是在单张 GPU 上跑完:

只能说,还是那个 Qwen,还是不负众望啊。。。
从 Thinking 推理档位到上下文理解,27B 还有这些功能
除了前面这些榜单表现,Qwen3.8-27B 这次还有一个很实用的变化。
那就是模型到底要「想多久」,我们现在可以自己手动调了,因为 27B 里内置了个「推理档位」——
模型默认开启 Thinking 模式,同时支持 reasoning_effort 调节推理深度,一共分成 xhigh、medium 和 low 三档。
复杂代码、长程 Agent 这类任务可以把档位拉高;简单问答、摘要、轻量任务则可以降下来,优先换速度和成本。
此外 Thinking 本身也能直接关闭,让模型跳过推理过程直接回答,真 diy 私人定制了。

此外在长任务这件事上,还有一个挺实用的功能—— Qwen3.8-27B 默认开启了preserve_thinking。
简单说,就是 Agent 前几轮「怎么想的」可以继续留在后面的上下文里。
比如 Coding Agent 连续改十几个文件,做到后面时还能沿着前面的决策继续走,少一点每轮重新捋思路的重复劳动,同时也能更好利用 KV Cache。
小小的身形,想把长任务稳稳扛住,底层架构也得下点功夫。
具体来说 Qwen3.8-27B 一共 64 层,其中 48 层采用 Gated DeltaNet 线性注意力,16 层保留完整 Attention,基本按照「三层线性注意力 + 一层完整 Attention」的节奏循环。
线性注意力负责降低长序列下的计算和缓存压力,完整 Attention 则隔几层做一次更充分的信息交互。
这样带来的最大好处就是—— Qwen3.8-27B 原生上下文能做到 262K Token,还可以继续扩展到 100 万 Token!!!

最后说一下大家同样比较关心的问题——怎么把模型跑起来。
其实,非常之简单。
官方已经给模型接上了 Transformers、vLLM、SGLang 和 TokenSpeed。
如果是生产环境或者需要高吞吐,Qwen 更推荐 SGLang、vLLM 这类专门的 Serving 引擎。
当然,本地玩家则可以更省事一点儿。
Hugging Face 也提供量化版本入口了,大家可以直接通过大家熟悉的工具链部署。
换句话说,手里有一张高端消费级显卡或者大内存 Mac,基本已经可以开始折腾这只 27B 了。(doge)
官方开源链接放下面了,感兴趣的友友可以直接上手搓搓~
参考链接:
[ 1 ] https://mp.weixin.qq.com/s/Ttv5cMD5p6DkUQWyoOsqCA
[ 2 ] https://huggingface.co/Qwen/Qwen3.8-27B
[ 3 ] https://www.modelscope.cn/collections/Qwen/Qwen38
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见

