来源:中国企业家
来源:中国企业家杂志

拒绝疯狂堆参数,大模型竞赛换了评判标尺。
文 |《中国企业家》记者 闫俊文
见习编辑 | 李原 编辑 | 何伊凡
头图来源 | 视觉中国
8 月 31 日,智谱发布了 2026 年半年报。财报显示,1 月至 6 月,智谱营收 9.539 亿元,同比大增约 400%;毛利 2.52 亿元,同比增长 163.7%,期内亏损 20.72 亿元,去年同期亏损 23.58 亿元;研发支出 21.3 亿元,同比增长 33%。
智谱董事长刘德兵表示:如果去年智谱的关键词是 " 智能上界 ",今年上半年的关键词就是 " 能力兑现 "。
从收入结构看,智谱商业化进入了快速增长的规模化阶段。上半年开放平台及 API 业务收入约 8.25 亿元,同比增长 2735.7%,占总收入的比例从去年同期的 15.2% 升高到 86.5%。由此看出,智谱的收入结构已经发生了根本性变化。
虽然智谱的收入数据已经够快了,但依然低于外部机构给出的 13 亿元收入预期。管理层也给出了另外一个指引信号,截至 2026 年 8 月末, 按月计的 ARR(年化收入) 已达到 16 亿美元。8 月单月,收入达到 1.33 亿美元,基本相当于前半年的营收规模。
" 海外前沿模型公司和行业内另一家公司,以最近一周数据乘以 52。考虑 GLM-5.3 的放量,若按该口径计算,最新 ARR 已超过 20 亿美元。" 智谱董秘肖磊表示。
营收暴涨的同时,智谱的算力支出依然沉重。公司的毛利率,从去年同期的 50% 下降至 26.4%。同时,大模型价格战仍在发酵。GLM-5.3 于 8 月 19 日上线,GLM-5.3-Flash 版本的价格比 " 内卷之王 "DeepSeek-V4-Flash 还要低。
8 月 28 日,巴克莱发布的 AI 行业研究显示:模型公司每获得 100 美元收入,其中约有 35~40 美元会以推理算力费用的形式流向三大云巨头:亚马逊 AWS、微软 Azure 和谷歌云平台。
财报和电话会中, 智谱管理层强调了公司角逐大模型竞赛的 " 北极星 " 指标——短期榜单 " 跑分 " 领先不再是最重要的,行业的胜负手是谁能以更快节奏、更优成本,持续将更强模型推向市场。
为此,智谱画出了一张图,除自家模型之外,还选择了 Kimi、DeepSeek、OpenAI 和 Anthropic 等厂商作为对比,横轴是范式进步,纵轴是智能指数,深度维度是单任务成本。

来源:智谱 2026 年半年报
价格仍是大模型衡量成本的敏感标尺。该图显示,在 8 月中旬之前,DeepSeek 占据了智能 - 成本图的第一名,但到了 8 月中旬,DeepSeek-V4-Pro 宣布涨价之后,GLM-5.3 及 GLM-5.3-Flash 版本取代 DeepSeek 成为新王。
支撑智谱实现反超的,是其坚定的技术路径。智谱管理层认为:同架构、同总参数、同激活参数,仅扩大后训练规模,端到端完成率提升超过 50%。GLM-5.3 的表现也由此印证,Scaling(模型规模缩放)并非只有堆参数这一条路径,后训练才是现阶段能力提升潜力最大的环节。
但这也引发了外界疑问:在 DeepSeek 和 Kimi 都在冲刺更大训练参数之际,智谱的 GLM-5.3 系列的训练底座依然沿用了 GLM-5.0,单纯加码后训练,强化 Infra,能否帮助模型打开更高的智能上限?
9 月 1 日港股开盘后,智谱股价一度上涨近 5%,午后震荡回落,截至收盘,智谱股价为 1179 港元,微跌 1.34%,总市值 5500 亿港元。
模型公司越来越重
智谱正在变得越来越重。根据财报,它的员工规模为 981 名,比 MiniMax 多一倍。此外,MiniMax 上半年无收购、并购举动,智谱则资本动作频频。
财报披露了智谱两项收购的进展:一是今年 5 月,智谱以不超过 3.61 亿元的代价收购北京红钻的 100% 股权,后者的主要资产是北京海淀区东北旺西路的钻石大厦。另一个是今年 6 月,智谱收购了 AI 基础设施研发厂商中科加禾 60% 的股权,收购价为 2.92 亿元现金,该收购已于 6 月完成。
今年 7 月,智谱完成 314.1 亿港元的配售新股(增发)。根据公告,该募资主要用于基础模型研发、算力基础设施以及收并购等。
自建算力中心已经成为模型公司资本开支的核心板块。有媒体报道,智谱已经落地了 1GW 级的数据中心,全部采用国产芯片。意在兼顾业务扩张的需求,同时谋求算力成本的进一步下降。

来源:AI 生成
智谱披露,GLM ‑ 5.3 ‑ Flash 的推理即由国产芯片集群提供服务。在训练与推理端,实现 10 万级国产芯片的规模化低成本推理后,单位 Token 推理成本较年初下降 80%。
算力正在成为瓶颈,单靠租赁已经不能解决模型训练要求和推理的爆发需求,模型必须和 Infra 紧密耦合,才能榨出最优效率和最高能力。
据智谱财报,从成本端看,公司销售成本由 9545 万元增加至 7.02 亿元,同比增长 635.4%,主要受计算服务费用增加的影响。
模型厂的支出正在流向云厂商。2026 年第二季度,阿里云季度收入为 484.37 亿元,对应(阿里 2027 财年第一财季)同比增长 45%,增速创 22 个季度新高。
为了解决国产芯片的内存容量与带宽的挑战,智谱优化了 Infra 层,提升了单位智能的密度—— " 算力乘数 "(大模型公司每投入 1 元算力所对应的开放平台及 API 收入)。智谱今年的算力乘数较去年上半年提升了 14 倍,也侧面表明,公司的算力供给效率得到了显著改善。
后训练如何取胜?
智谱对自身技术路线的总结是,在对的时间,用对的数据,训练对的规模,有了对的模型,而非最大规模。追求在当前数据与算力约束下,把训练深度做够后,获得足够智能收益的模型。
这一思路,也显著区别于 Kimi 和 DeepSeek。
7 月中旬,Kimi K3 发布,总参数量为 2.8 万亿,激活参数约 104B,是目前全球参数规模最大的开源模型。今年 4 月发布的 DeepSeek-V4-Pro 总参数量为 1.6 万亿,预训练数据量 33T,激活参数约 49B。
而智谱在今年 2 月上线的 GLM-5.0,参数规模仅为 7440 亿,激活 40B,预训练数据量为 28.5T,参数规模和预训练均落后于月之暗面和 DeepSeek。

来源:视觉中国
面对外界的疑问,智谱创始人唐杰表示,模型规模是一项综合选择,需要同时考虑资源、数据和用户可用性。国内训练数据通常处于 30T 至 50T Token 量级。在这一数据规模下,按照 Scaling Law 大幅扩大模型,边际收益未必足够高;算力有限的前提下,更要判断什么规模最优。
" 另一方面,中训练和后训练的潜力仍未释放到上限,当前阶段单纯扩大参数并非最关键。公司并没有停止 Scaling 基座,而是按既定路线分阶段推进。" 唐杰说。
唐杰所说的既定路线是指:2026 年 1 月,公司训练了 GLM-5.3 使用了约 7440 亿参数基座,智谱仍计划让这一基座使用半年以上;GLM-5.1、5.2 和 5.3 的中训练、后训练、任务环境和 SFT 数据安排,年初已经完成规划。
" 下一代模型的推理系统已开始预研,目标是模型发布第一天就能以足够规模服务用户,而不是做出参数很大却无法经济部署的模型。" 唐杰说。
以 GLM-5.3-Flash 为例,它采用的全新架构专为降低成本设计,基准测试与实际应用表现均优于 GLM-5.2,价格却仅为 GLM-5.2 的十分之一。
此外,唐杰也提到了模型的 RSI(递归式自我改进),他称之为 Fully Self-Training,让模型参与到预训练、中训练和后训练,并逐步形成自我进化能力。
他直言:最大的难点并非继续扩大模型,而是让模型能可靠地判断何时停止、何时纠错,以及如何评价自身训练结果。
特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的 30 天内进行。


登录后才可以发布评论哦
打开小程序可以发布评论哦