过去一周在全球开发者社区刷屏的神秘模型 " 牛来 ",终于揭开了面纱。
8 月 26 日晚,智谱正式发布并开源 GLM-5.3-Flash(320B-A18B),同时官方确认,此前以 Ox-Alpha 名义在 OpenRouter、OpenCode 两大平台匿名测试并迅速登顶调用量榜首的模型,正是这款新品。Ox 意为 " 牛 ",恰逢电影《牛来》走红,中文开发者社区便给它起了 " 牛来 " 这个绰号。
从 8 月 20 日匿名上线到 8 月 26 日被认领,短短六天时间里,Ox Alpha 已经让全球开发者消耗了数十万亿 Token。
据 OpenRouter 最近七天统计窗口数据,Ox Alpha 处理约 23.2 万亿 Token,排名第一;同期 DeepSeek V4 Flash 约为 11.6 万亿 Token,前者上线不到一周,Token 处理量已达到后者的两倍。

真正让业界震动的不只是流量,而是性能与价格的组合。
GLM-5.3-Flash 总参数量 320B、每 Token 激活参数仅 18B,共 45 层,是 GLM-5 系列首个原生多模态模型,支持文本、图像和视频输入,上下文窗口最长约 100 万 Token。
在 Artificial Analysis Intelligence 综合智能指数中,该模型取得 57 分,与 Anthropic 旗舰模型 Claude Opus 4.8 持平,高于 DeepSeek V4 Pro 正式版的 53 分。Stripe CEO Patrick Collison 试用后在 X 平台评价称:" 非常令人印象深刻。"

这一定价策略正值国内大模型集体涨价之后,Kimi K3 输出价格高达每百万 Token 100 元,DeepSeek V4 Pro 从 6 元涨至 13.5 元,高峰时段达 27 元。据报道,DeepSeek V4 Flash 提价后在 OpenCode 平台调用量下滑一半,这部分外溢需求恰好被 GLM-5.3-Flash 承接。
更值得关注的是算力底座。
智谱确认,匿名测试期间的全部请求流量均由国产芯片提供算力,共调用超过 10 万张国产芯片集群用于推理服务,这是智谱首款大规模落地应用该混合架构的开源多模态大模型。
据了解,这批芯片供应商或来自华为、摩尔线程与海光,智谱官方未予置评。为突破单张芯片内存容量与带宽瓶颈,智谱基于 SGLang 构建专用推理引擎,采用 W8A8 量化、INT8/FP8/BF16 混合缓存量化及 EPD 分离架构等技术,与同一硬件初始基线相比,端到端服务性能提升了 3 倍,智谱称最终硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平。
半导体研究机构 SemiAnalysis 随即在 X 平台发文评论:" 所有流量均由国产芯片承载,硬件效率和单 token 成本已可与英伟达 GPU 相媲美。继 Jalape ñ o(OpenAI 自研推理芯片)昨日宣布之后,CUDA 护城河再度受到考验。"

智谱还专门训练了模型的自我视觉判断和测试时改进能力,官方展示案例中,该模型在无外部素材情况下自主运行 16 小时,在 Blender 中搭建了一套约 400 平方米的专业主厨住宅与测试厨房。
受此消息驱动,8 月 27 日智谱股价大幅高开。当日以 1115 港元开盘,涨幅达 8.25%,盘中一度涨超 9%,最高触及 1163 港元。截至收盘,智谱报 1160 港元,上涨 130 港元,涨幅达 12.62%,全天成交额 76.54 亿港元,换手率 2.84%,总市值约 5405.60 亿港元。

值得一提的是,智谱计划于下周一发布首份详细财报,覆盖今年 1 月上市以来前六个月业绩。此次 GLM-5.3-Flash 的发布及其市场表现,将为投资者评估公司商业化进展提供重要参照。
从匿名测试到官宣开源,六天时间里," 牛来 " 用真实流量验证了前沿模型能力、国产芯片大规模在线承载和极低 API 价格可以同时成立,这也让市场对国产大模型的商业化路径有了新的想象空间。
来源:星河商业观察


登录后才可以发布评论哦
打开小程序可以发布评论哦