观察者网 6小时前
智谱认领“牛来”模型,跑在10万张国产芯片上
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(文 / 陈济深 编辑 / 吕栋)

此前在海外开发者圈掀起热议的匿名模型 "Ox-Alpha"(中文社区俗称 " 牛来 "),正式揭开了真实身份。

8 月 26 日晚,智谱正式上线轻量旗舰多模态模型 GLM-5.3-Flash,并在当天以 MIT 协议面向全球完全开源。

在正式认领前,Ox-Alpha 在 OpenRouter 与 OpenCode 两大海外主流聚合平台进行了多日匿名盲测。首日便冲上 OpenRouter 榜首,单日 Token 处理量达到平台此前历史峰值的 4 倍;据 OpenCode 方面称,Ox-Alpha 终结了此前 DeepSeek 连续 56 天的霸榜纪录。

OpenRouter 宣布 Ox-Alpha 真实身份为智谱 GLM-5.3-Flash 图片来源 OpenRouter

OpenRouter 公开数据显示,在 Ox-Alpha 登顶后,全平台调用量前五的席位已全部被中国大模型占据。

Ox-Alpha 登顶 OpenRouter 周榜,榜单前五均为中国模型 图片来源 OpenRouter

观察者网了解到,这股席卷海外开发者的超大规模并发流量,并非跑在传统的海外算力底座上,而是由 10 万张国产算力芯片组成的超大集群全程承载,累计处理请求流量高达 62T Token。

在国际评测机构 Artificial Analysis 发布的综合智能指数(AA Intelligence Index)中,GLM-5.3-Flash 斩获 57 分,追平海外公认的顶级旗舰 Claude Opus 4.8。而在实际调用价格上,该模型直接打到了后者的四十分之一。

GLM-5.3-Flash 在 Artificial Analysis 智能指数与任务成本中的位置 图片来源 智谱

8 月 27 日,智谱(02513.HK)收涨 12.62%,报 1160 港元 / 股,市值重返 5000 亿港元。

这头跑在 10 万张国产芯片上的 " 纯血国产牛 ",不仅作为中国开源模型军团的最新成果持续打破了海外巨头 " 前沿智能必然昂贵 " 的溢价神话,更顺势接过了此前由 DeepSeek 树立的平价大旗,在 Agent 生态中划出一条全新的价格 " 斩杀线 ",刷新了大模型产业落地竞争的新一轮竞争起点。

接力 DeepSeek

7 月底,DeepSeek-V4-Flash 正式上线,凭借强劲的推理与代码能力以及极低定价,迅速在行业内掀起降价潮,甚至直接倒逼 OpenAI 等海外大厂以打折促销跟进,DeepSeek-V4-Flash 在事实层面成为了大模型行业的性价比斩杀线。在上线初期,该模型在 OpenCode 平台上的单日处理量迅速突破 8 万亿 Token,第一次让全球开发者体验到不必盯着账单跑长链路 Agent 任务的红利。

然而,Agent 时代的工作流对价格极度敏感。Agent 的核心是后台长任务循环:读取上下文、检索代码、调用工具、多轮试错。一个任务可能反复循环几十次,微小的 Token 价差在海量调用中会被成倍放大。

当 8 月 17 日 0 时起 DeepSeek 实行峰谷定价、高峰时段价格大幅上调后,平台日调用量从峰值回落超过一半,空出了近 10 万亿 Token 的庞大日常需求缺口。智谱以 Ox-Alpha 的匿名身份在此窗口期迅速切入,凭借以免费试用为主的盲测策略,承接了相当一部分外溢流量。

而在 8 月 26 日正式认领并开源后,GLM-5.3-Flash 公布的商业定价进一步确立了其 " 价格屠夫 " 的地位,顺势刷新了这条斩杀线。

在商业定价上,GLM-5.3-Flash 国内官方 API 标准定价为每百万 Token 输入 0.8 元、输出 2.8 元,仅为 GLM-5.3 的十分之一;上线期间实行半价后,折算价格降至二十分之一。横向对比调价后的 DeepSeek-V4-Flash(谷时输入 1.5 元、输出 4.5 元),GLM-5.3-Flash 在绝大多数常规输入输出场景下综合账单更低。

在国际市场上,该模型公布的输入价格为 0.3 美元、输出 1.2 美元,半价期间输出价格仅为 0.6 美元,约为海外顶级模型 Claude Opus 4.8 官方价格(输出 25 美元)的四十分之一,将前沿编程与 Agent 能力的门槛进一步拉低。

从后训练转向专属架构:国产卡也跑得起

如果说此前 GLM-5.2 与 GLM-5.3 的连续发布,印证了智谱在后训练(Post-training)与强化学习方法论上的积累,那么 GLM-5.3-Flash 则展现了一条截然不同的技术路径。

尽管冠以 Flash 之名,但智谱并没有在既有的重型底座上继续依靠蒸馏、剪枝或后训练小修小补,而是选择从第一行代码和初始权重开始,为高并发、低成本的推理场景重新设计了一套经济型专属架构。

这套架构的核心在于对计算开销的极端克制。模型总参数量为 320B,但单次前向传播的激活参数被压缩到了仅 18B,模型层数较上一代 GLM-4.5 的 92 层腰斩至 45 层。

观察者网获悉,该模型直接依托智谱最新的 30T Token 原生多模态预训练语料从零构建。

测试数据显示,GLM-5.3-Flash 在综合能力上超过了总参数量翻倍的上一代重型旗舰 GLM-5.2(743B-A40B,AA 指数 53 分),也领先于 DeepSeek-V4-Pro 正式版(53 分)和 DeepSeek-V4-Flash(52 分)。在智谱自建的代码基准 Z.ai Code Bench 中,其实际编程与工具调用体感同样稳居第一梯队。

在解决 1M 超长上下文的显存与计算瓶颈上,该架构采用了稀疏注意力与线性注意力的混合设计。线性注意力通过递归机制以极低开销捕获局部依赖,稀疏注意力借助轻量索引器精准召回全局上下文。

在此基础上,智谱自研的 IndexPool 技术通过加权池化将索引器缓存实现四合一压缩,配合流形约束超连接(mHC)保障小激活参数下的扩展表现。相较于 GLM-5.3,该模型的单 Token 注意力计算量下降了 3.01 倍,KV 缓存占用降低 4.44 倍,从算法源头上为国产算力的高效承载扫清了障碍。

过去,国产算力芯片很少直接面对全球化、高并发、不可预测的突发流量大考。面对 1M 长上下文和多模态对单卡显存容量与互联带宽的极限挤压,智谱在 SGLang 框架之上为国产算力构建了专属推理服务栈。

在该技术栈中,智谱在底层结合了节点内张量并行、ReplaySSM、W8A8 量化与 INT8/FP8/BF16 混合缓存量化技术,同时配合自研 Layersplit 与 KV broadcast 通信优化;在集群调度层面,全面上线生产级 Encode – Prefill – Decode(EPD)分离式架构,将多模态编码、提示词预填和逐 Token 解码拆分为相互独立、动态扩缩容的工作池。整套复杂集群的编译调优与算子开发,由 GLM-5.3 驱动的 Infra Agent 协同完成。

最终,这套运行在国产芯片上的服务栈端到端性能提升了 3 倍,硬件效率和单 Token 推理成本已基本追平主流英伟达 GPU。

此外,GLM-5.3-Flash 以 320B-A18B 的超轻激活结构与 MIT 协议开源,为国内芯片厂商提供了一套开箱即用的前沿模型标准载体,意味着更多国产硬件可以直接承载 320B 级别的前沿模型部署,降低了实际商业化推理的适配门槛。

原生多模态:打通视觉代码与复杂生产力闭环

在实际应用能力上,GLM-5.3-Flash 是 GLM 家族首个原生多模态模型。智谱将其多模态能力重点投向了 " 视觉编码(Visual Coding)" 领域,模型不仅能看懂静态图像,更能主动观察代码渲染出的图形界面、3D 空间或交互动态,并依据视觉反馈进行自主纠错与迭代。

在开发者社区披露的实测案例中,知名独立开发者通过 Ox-Alpha 与 GLM-5.3 消耗近千亿 Token,自主编写了 50 万至 60 万行代码,端到端生成了一个超大规模的可玩 Web 游戏。

在纯视觉驱动下,模型仅凭外部素材便能通过 Godot 引擎还原出类《喷射战士》的涂地对战与类《胡闹厨房》的协作玩法;在无外部素材输入的情况下,模型依托自研视觉反馈流水线,在 Blender 中自主连续运行 12 个小时,完整搭建了一套 1400 至 2000 平方米、包含 12 个功能区的高精度天空餐厅与酒吧 3D 场景;

在工业制造领域,模型甚至能直接读取 CAD 工程图纸草稿,编写出 Python build123d 参数化代码,复刻复杂的 3D 机械零件。

模型读取的 CAD 工程图纸草稿 图片来源 智谱

模型根据工程图复刻的 3D 机械零件 图片来源 智谱

在白领高阶生产力场景中,该模型同样具备直接交付能力。在金融场景下,模型能够覆盖从多源信息溯源研报、SOTP 估值、三表勾稽复核到 DCF 敏感性分析;在商务场景中,模型能依据模板起草格式严谨的经销合作协议,直接生成具备专业排版质感的 Word 与 PPT 文档。

随着大模型进入 Agent 落地期,行业竞争逻辑正在发生转变。

单纯在发布会上比拼 Benchmark 跑分已很难维持开发者的黏性,谁能把架构效率做到极致、用更低的实际账单支撑起 Agent 全天候的长循环任务,谁才能真正成为开发者工具链中的默认选项。

就在智谱开源 GLM-5.3-Flash 的当晚,阿里也几乎同步推出了主打极低激活参数的 Qwen3.8-Flash(采用下一代 Next 架构),两家厂商不约而同地将发力点转向了经济型推理模型。

从最初依赖补贴打价格战,到如今通过架构创新和软硬协同压低真实推理成本,中国 AI 厂商正在用更务实的工程解法,争夺全球生产力底座的话语权。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

神话 芯片 开源 mit
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论