雷锋网 昨天
Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

Qwen3.8-27B 开始和顶级闭源模型正面叫板,过度思考是最大问题。

    作者丨李娜

    编辑丨岑峰

                                                                                                       

8 月 17 日,阿里发布的 Qwen3.8-27B 成为 Hugging Face 上排名第一的热门模型。Qwen 正在成为全球开源社区的 Base Model。

01

一个 27B 的模型,

为什么突然让全球 AI 社区兴奋?

如果只看参数,Qwen3.8-27B  并不像一个会制造太大声量的模型。27B参数,在今天动辄数千亿甚至万亿参数的旗舰模型面前,甚至显得有些 " 小 "。但 2026 年 8 月 14 日,阿里千问正式开源 Qwen3.8-27B 之后,海外 AI 社区的反应却异常热烈。

原因恰恰就在这个 " 小 " 字上。

在 Qwen 官方公布的成绩里,Qwen3.8-27B 已经开始在部分 Coding 和 Agent 测试中,与 Claude Opus 4.6 Max 这样的前沿闭源模型放在同一张表格里比较。与此同时,4bit 量化后约 17.1GB,一张 RTX 4090 或 3090 就能完整装下,进入了个人设备能够尝试本地运行的范围。

这形成了一种过去并不常见的反差:一边是消费级硬件能够承受的模型尺寸,另一边却开始出现过去只有云端旗舰模型才会被期待的 Coding 和 Agent 能力。

独立开发者 Simon Willison 直接评价 Qwen3.8-27B "excellent",Reddit 社区中 LocalLLaMA 上有人把它称作 " 游戏规则改变者 ";另一些实际用它完成 Coding 任务的用户,则开始用 " 接近 Opus" 来描述自己的体验。围绕它的讨论,也很快从传统的 " 这个模型 Benchmark 多少分 ",变成了 " 我的 3090 能不能跑 ""24GB 显存用什么量化 "" 能不能直接接进 Coding Agent"。

过去谈到本地部署模型,默认往往意味着一种交换:用户获得隐私、可控和更低的使用成本,同时接受能力上的明显妥协。真正复杂的 Coding、工具调用和长程 Agent 任务,仍然主要属于 Claude、GPT 这类运行在云端的前沿闭源模型。Qwen3.8-27B 正在挑战的,正是这个默认前提。

02

Qwen3.8-27B

开始达到旗舰模型的上限

Qwen3.8-27B 最值得关注的是,它用 27B 的尺寸同时承载了 Coding、Agent、长上下文、多模态四项能力

27B 并不算一个极小的模型,但它已经进入个人硬件可以真正部署的范围。经过 4bit 量化后,部分版本的模型权重只有 17GB 左右,一张 24GB 显存的 RTX 3090 或 4090 就有机会把完整权重装进显存。相比动辄数百亿、数千亿参数,必须依赖多卡服务器运行的旗舰模型,这已经是完全不同的部署门槛。

Qwen3.8-27B 对长上下文的设计也明显服务于这个目标。它共有 64 层,其中 48 层采用 Gated DeltaNet,16 层保留完整 Attention。传统全注意力需要随着上下文不断增长 KV Cache,而 DeltaNet 使用固定规模的循环状态,因此可以降低长文本带来的显存压力。模型原生支持 262K 上下文,并可以进一步扩展到 100 万 Token。

但这些只是前提。真正让它和 Opus 4.6 Max 放在同一张表格里的,是 Agent 和 Coding。(雷峰网 ( 公众号:雷峰网 ) )

在 Qwen 官方公布的数据中,Qwen3.8-27B 在 SWE-bench Pro (真实 GitHub issue 修复)上达到 61.7,官方列出的 Claude Opus 4.6 Max 成绩为 53.4;OSWorld-Verified (电脑操作)为 84.3 对 72.7,AndroidWorld (手机操作)为 81.9 对 62.0,CoWorkBench(长周期办公任务) 为 70.7 对 68.2。LiveCodeBench v6 (代码生成)上,Qwen3.8-27B 也达到 90.3。

官方榜单之外,一批社区横向测试也在提供更直观的参照。

有开发者用完全相同的 Prompt,让  Qwen3.8-27B 和上一代 Qwen3.6-27B  分别生成同一个 voxel pagoda。在同一台 DGX Spark、相同量化设置下,3.8 在场景完整度和视觉效果上都明显更成熟。

再往外看,有用户把它和同体量的 Glimmer-30B 放在一起测试 Three.js 场景。此前 Glimmer-30B 已经是 30B 左右本地模型里表现相当强的一档,但换到 Qwen3.8-27B 后,用户最终仍然把优势判给了 Qwen。

更有意思的是,社区已经开始直接拿它和 Claude Opus 做同 Prompt 的前端生成对比。单个 Demo 显然不能证明 Qwen 已经达到 Opus 的整体水平,但这种比较本身已经说明了问题:过去一个本地 27B 模型和顶级闭源模型之间,往往根本没有正面对比的必要;现在至少在部分 Coding 和前端任务上,两者已经可以放在同一个画面里比较。

把这些结果放在一起,Qwen3.8-27B 目前的位置大致已经可以看清:和上一代 27B 相比,它的能力上限明显往前走了一截;放到 30B 左右的本地开源模型里,它已经处在第一梯队;而在部分 Coding 和 Agent 任务上,它甚至开始摸到前沿闭源模型的能力区间。

如果 Qwen3.8-27B 只能通过 API 调用,它最多只是又一个强模型。但经过量化后,它已经能进入个人工作站和企业私有环境,代码、文档和 Agent 工作流都可以留在本地。一个个人硬件能够承受的 27B 模型,开始进入过去主要属于前沿闭源模型的 Coding 和 Agent 能力区间。

过去本地部署往往意味着牺牲能力,Qwen3.8-27B 正在缩小这种能力折扣。

03

过度思考,是它最大的问题

在海外社区,有人已经把 Qwen3.8-27B 称作 "Opus at Home"。但榜单之外,围绕它最集中的争议也很明确:模型能力强,但是推理时间太长;而 Benchmark 上的领先,也还没有完全转化成真实 Agent 体验。

▎为了一个答案,它能先想 21 分钟

问题首先出在 reasoning_effort 上。Qwen3.8-27B 提供  xhigh、medium、low、none  四档推理强度,默认使用最高的 xhigh。对于复杂 Coding 和长程 Agent,这可以换来更充分的推理;但放到消费级硬件上,代价也非常直接——慢,而且大量消耗 Token。

Django 联合开发者 Simon Willison 做过一个很典型的测试:让模型生成一张 " 骑自行车的鹈鹕 "SVG,Qwen3.8-27B 花了  21 分钟,产生  22,276 个推理 Token,最终输出只有 3,223 Token;关闭深度思考后,同一个任务缩短到 137 秒。社区里类似反馈并不少见。有人让它写一个简单游戏,模型先思考了半小时;也有人把它接进 Coding Agent,一次任务的思维链跑掉数万 Token。

这也暴露了 Qwen3.8-27B 目前最明显的矛盾:它的能力上限很高,但默认设置并不一定适合本地用户。

对于云端旗舰模型,长时间推理更多表现为价格和等待时间;到了 3090、4090 这样的个人硬件上,推理强度会直接变成速度、显存和使用体验。一个本来以 " 本地可跑 " 为最大优势的模型,如果简单任务也需要长时间思考,这个优势就会被部分抵消。

▎榜单赢了,真实 Agent 未必赢

另一个需要降温的,是 " 超 Opus" 这个说法。

Qwen3.8-27B 在 SWE-bench Pro、OSWorld-Verified 等测试上的确表现亮眼,但这些仍然是标准化、受控环境下的任务。真实 Agent 面对的变量更多:任务可能持续几个小时,需要反复调用工具、修改代码、处理异常,还要保证过程中不跑偏。

(Qwen3.8-27B 总分 48.0%,排名第 15;该 Benchmark 共 60 项真实 Agent 任务。)

在更复杂的真实任务里,27B 的优势并没有那么绝对。例如在 WildClawBench 的 60 项 Agent 任务中,Qwen3.8-27B 虽然明显超过前代,但仍落后于一些更大的托管模型。

这也是为什么不能直接把 " 某几项 Benchmark 超过 Opus" 翻译成 " 真实使用已经可以取代 Opus"。实际使用最终看的不是一张榜单,而是几个更难回答的问题:长任务能不能稳定完成,工具调用会不会出错,代码修改能不能收敛,以及为了得到这个结果,需要等待多久、消耗多少计算。

因此,现在给 Qwen3.8-27B 一个更准确的位置,可能不是 " 本地 Opus",而是:

它已经证明,27B 开源模型有资格进入顶级闭源 Agent 的比较范围,但还没有证明自己能够全面替代它们。

04

真正的变化:

前沿 Agent 正在开始进入个人电脑

回到开头那个问题:一个 27B 模型,为什么能让全球社区这么兴奋?

过去几年,本地模型一直有一个默认前提:隐私、便宜、可控,但能力要妥协。  一个能在消费级硬件上运行的模型,意味着你得接受它在复杂 Coding、多步推理、工具调用上的明显短板。真正要干活,还是得切回 Claude 或 GPT。本地运行和前沿能力之间,存在一条清晰的分界线。

Qwen3.8-27B 第一次让这条线变得模糊了," 本地运行 " 和 " 前沿 Agent 能力 " 正在第一次变成可以同时追求的东西。

过去开源模型的叙事是 " 追上闭源 "。Qwen3.8-27B 的叙事是 " 闭源模型的能力,第一次以可部署的尺寸出现在本地硬件上 "。前者是追赶,后者是下放。追赶是总是暂时的,你今天追上,明天可能又被拉开;下放则是结构性的,一旦能力被压缩到消费级硬件可承受的尺寸,它就不会再缩回去了。

前沿 Agent 能力正在从云端下放到个人电脑,这才是 Qwen3.8-27B 真正值得被记住的原因。它也许不是最终的答案,但它逼出了下一个必须回答的问题:如果未来所有 27B 级别的模型都具备这种 Agent 能力,开发者的工作流、企业的部署策略、甚至个人采购 GPU 的逻辑,是不是都要跟着重写一遍?

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 ai 阿里 李娜 reddit
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论