腾讯科技 3小时前
智谱“牛来”模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

文|晓静

编辑|徐青阳

匿名六天之后," 牛来 " 终于揭开了最后一层面纱。

8 月 26 日晚,智谱正式发布并开源 GLM-5.3-Flash。这款此前以 Ox-Alpha 身份在 OpenRouter、OpenCode 匿名测试的模型,总参数量 320B、激活 18B,是 GLM-5 系列首个原生多模态模型

与 GLM-5.3 相比,这个模型的价格低到有些出乎意料,它的价格仅为 GLM-5.3 的 1/10,限时折扣期进一步降至 1/20;与 Anthropic 旗舰模型 Claude Opus 4.8 相比,约为 1/40。

Artificial Analysis 目前给 Claude Opus 4.8 的 Intelligence Index 评分为 57 分,它的官方 API 标准价格为每百万 Token 输入 5 美元、输出 25 美元。 智谱披露,GLM-5.3-Flash 在同一指数中同样获得 57 分;在智谱自研的 Z.ai Code Bench 中,两者的 Coding 实际使用体验也处于相近水平。

虽然这并不意味着 GLM-5.3-Flash 已经在所有任务上 " 等于 "Opus 4.8,单项 Benchmark、长任务稳定性和真实 Agent 任务仍可能存在差异,但至少从第三方综合测试来看,一款开源模型已经进入此前主要由高价闭源旗舰占据的能力区间。

更重要的是,这次低价并不是建立在海外 GPU 推理集群之上。

01

" 牛来 " 背后,全部跑在国产芯片上

GLM-5.3-Flash 的发布,也回应了此前围绕 Ox-Alpha 最大的一个疑问:如此大规模的海外免费测试,背后的算力从哪里来?

智谱确认,正式发布前,GLM-5.3-Flash 以 Ox-Alpha 为名,在 OpenCode 和 OpenRouter 进行匿名测试。模型很快成为当周最受欢迎的模型,并创下两个平台调用量新高。

这些请求流量全部由国产芯片提供算力。

据悉,智谱共调用了超过 10 万张国产芯片集群用于该模型服务,但未公布具体的芯片型号。这也是智谱首次尝试使用一个大规模国产芯片集群,直接承载来自全球开发者的真实线上负载。

匿名测试期间,用户并不知道模型背后是谁,也不知道使用什么芯片,只会根据速度、稳定性和效果决定是否继续调用。国产算力因此接受了一次持续的真实流量测试,并不是实验室环境下的峰值性能展示。

根据官方信息,为了让前沿模型真正跑在国产芯片上,智谱对推理系统做了大量针对性改造。

单张国产芯片当前面对的主要瓶颈包括内存容量和带宽,而 GLM-5.3-Flash 又原生支持最长 1M 上下文,对显存和通信提出了更高要求。

智谱基于 SGLang 构建了专用推理引擎,并加入节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化以及 Layer Split 等技术,通过 " 以算力换带宽、以通信换显存 " 的方式降低硬件限制。

在集群层面,采用 Encode-Prefill-Decode,也就是 EPD 分离架构。多模态编码、Prompt 预填充和逐 Token 解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。

按照智谱公布的数据,与同一批硬件上的初始基线相比,这套方案将端到端服务性能提高了 3 倍。智谱称,最终硬件效率和单 Token 成本已经达到与主流英伟达 GPU 相当的水平。

这里需要区分两个概念。

所谓 "1/40",并不是说国产芯片的硬件推理成本只有海外 GPU 的 1/40。目前公开数据并不足以支持这样的比较。

更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了 Claude Opus 4.8 的大约 1/40。

02

320B,为什么比上一代旗舰还强

价格下降的另一半原因来自模型结构。

GLM-5.3-Flash 总参数量 320B,每个 Token 激活 18B 参数。作为参照,GLM-4.5 总参数量 355B、激活 32B,共 92 层;GLM-5.3-Flash 则为 320B 总参数、18B 激活参数和 45 层。相比 GLM 早期旗舰架构,每 Token 实际参与计算的参数量和网络深度都明显下降。

但按照智谱公布的 Benchmark 和实际使用结果,GLM-5.3-Flash 整体能力反而超过了参数规模更大的 GLM-5.2。

这意味着 "Flash" 这次不再只是把旗舰模型简单缩小,它从架构层面重新设计了推理成本。

GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型

其中,线性注意力通过递归机制处理局部依赖;稀疏注意力则使用轻量级索引器,在长上下文中召回真正需要计算的全局信息。

针对 1M 上下文下索引器自身的内存和延迟问题,智谱又引入 IndexPool,通过加权池化,把索引器原本的 4 个缓存向量压缩成 1 个。

按照智谱的测算,与 GLM-5.3 相比,GLM-5.3-Flash 的注意力计算量降低 3.01 倍,KV 缓存大小降低 4.44 倍。

在智谱列出的 GLM-5.3、DeepSeek-V4-Flash 和 Kimi-K3 等基线模型中,GLM-5.3-Flash 的注意力计算量最低。不过,其平均每层 KV 缓存大小仍略高于 Kimi-K3 和 DeepSeek-V4-Flash。

这组数据一定程度上解释了为什么价格可以 " 打下来 "。

尤其对于 Coding 和 Agent 任务,一个任务可能连续运行数十分钟甚至数小时,模型不断读入代码、历史对话和工具返回结果,上下文持续增长。注意力计算量和 KV 缓存直接决定了长任务需要消耗多少显存、算力和推理成本。

GLM-5.3-Flash 还引入流形约束超连接 mHC,并使用 30T Token 多模态预训练语料,在降低参数量和计算量的同时,继续提升模型扩展能力。最终形成的不是一款单纯 " 更小 " 的模型,更准确的说,是一套围绕低成本推理重新设计的模型架构。

03

Flash 开始进入前沿模型区间

另一个变化,是 "Flash 模型 " 的定位正在改变。

过去,Flash、Mini、Air 通常意味着更快、更便宜,同时接受明显的能力折损。

GLM-5.3-Flash320B 总参数、18B 激活参数,在 Artificial Analysis 综合智能指数上拿到 57 分,与 Claude Opus 4.8 持平,同时价格只有后者的约 1/40。

它还是 GLM-5 系列第一款原生多模态模型。

这次加入视觉,并不是只是简单增加一个 " 看图 " 能力,目的为了直接服务于 Coding 和 Agent。对于网页、游戏、3D 建模等任务,模型最终生成的并不仅是代码,还有真正呈现在屏幕上的页面、交互和虚拟场景。

只有模型能重新 " 看见 " 自己生成的结果,才能知道按钮是不是错位、页面是否真的渲染成功、3D 场景是否符合预期,再继续修改。

智谱因此专门训练了模型的自我视觉判断和测试时改进能力,让模型在生成之后继续观察结果,并根据环境反馈迭代。

例如,官方展示的一个案例中,GLM-5.3-Flash 在没有外部素材的情况下,自主运行 16 小时,在 Blender 中搭建了一套约 400 平方米的专业主厨住宅与测试厨房。

类似机制也被延伸到 PPTX、PDF、DOCX、XLSX,以及金融和法律等专业任务:模型不仅生成内容,还能通过视觉结果继续检查和修改自己的输出。

对于 Agent 来说,这种变化比 " 多模态 " 本身更重要。过去的 Coding 模型主要判断代码是否正确;但它更需要去判断一项工作最终有没有真正完成。

如果单独看 GLM-5.3-Flash,这是一款参数更少、推理成本更低,同时进入前沿能力区间的新模型。

但 Ox-Alpha 匿名六天以来,测试了国产芯片能不能稳定、经济地承载一个前沿模型,并直接服务全球真实开发者。

与此同时,GLM-5.3-Flash 采用 MIT 协议开源,并同步开放 API。

前沿模型能力、开放权重、国产芯片大规模在线承载,以及极低 API 价格,同时出现。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论