作者 | 汤安迪
编辑 | 周欢
昨天梁文锋又变成了梁白开。
然后轮到智谱创始人唐杰登场了!
在 8 月 14 日,智谱推出了新模型 GLM-5.3。
Z.ai 的全球业务负责人李子玄基座模型和 GLM-5.2 共用同一个底座。
所有能力提升,全部来自后训练阶段的强化学习。
然后现在也有人给他做图了。
Terminal Bench 3.0,从 4.6 分直接跳到 28.3 分。
没有新基座,没有新架构,就是硬堆 RL。
智谱在官方博客里的原话是:Scaling post-training is all we did。
预训练的红利还没吃完?不,是后训练的红利你们根本没开始吃。
不换底座,只堆训练
智谱在 GLM-5.2 时期搭好了三根柱子,IndexShare 负责长上下文,SAO 负责长周期任务的 RL 算法,开源的 slime 框架负责大规模异步训练。
GLM-5.3 的做法简单粗,在这套栈上继续堆。
更多环境、更多样的任务、更多训练算力。
重点在环境。
新的训练环境不再是编程练习题,而是模拟资深工程师的真实工作现场。
有些任务的体量,相当于一个有经验的工程师要干好几天的活,比如在完整的 ML 基础设施里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。
智谱造了一条自动合成环境的流水线,研究智能体从真实工作里提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。
然后就有了:
编程开源第一。
GLM-5.3 是目前开放权重模型里编程最强的,没有之一。离闭源前沿还有一截。
Terminal Bench 3.0:GLM-5.3 拿 28.3,开源阵营第一,但 GPT-5.6 Sol 是 34.6,Fable 5 是 33.7。
DeepSWE v1.1:66.9,还是输给 GPT-5.6 Sol 的 72.7 和 Fable 5 的 69.7。
Agents' Last Exam 拿到 28.5,这个项目上倒是逼平了全场。
所以智谱在编程这件事上,开源第一,全局第二梯队头部。
意外
网络安全能力 " 涌现 " 了
智谱在后训练里加了漏洞发现相关的数据和环境,本来只预期模型 " 找漏洞更准一点 "。结果模型直接越过预期,开始自主规划完整的漏洞利用链条。
数字非常硬。
CyberGym(白盒源码审计):84.5%,全场第一,压过 Fable 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。
GLM-5.3 赢过所有闭源旗舰的项目!
ExploitBench(真实漏洞的深层利用推理):从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。
ExploitGym(限时完成漏洞利用任务):从 29/39 涨到 105/130。
越靠近攻击链的后端,涨得越凶。找漏洞是防守方技能,写利用链是进攻方技能,GLM-5.3 这个模型在进攻端的进化速度,比防守端快得多。
智谱自己用了 " 涌现 "(emergent)这个词:能力不是专门训出来的,是扩大 RL 规模时自然冒出来的。
官方称,从 GLM-5.2 开始就与国内安全团队合作,用模型扫描真实代码库。
经专家审核去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个中高危。覆盖操作系统内核、浏览器引擎、网络协议这些核心基础设施,有些漏洞在代码里藏了几十年,最老的一个据智谱称可追溯到约 40 年前。
这可能会成为 AI 安全领域今年最值得警惕的信号之一。
因为 " 涌现 " 意味着,任何一家把 RL 规模堆到同一量级的实验室,都可能一觉醒来发现自己手里多了一个网络武器。
和 Anthropic
不一样
目前 53 个漏洞已公开披露,2,383 个还在保密期。智谱上线了一个公开的漏洞披露追踪页面,持续更新进度。
这套打法眼熟吗?
今年 4 月,Anthropic 的 Claude Mythos 走了几乎同一条路,自主发现数千个零日漏洞, Mozilla 用它在一个浏览器版本里就扫出 271 个,还有藏了 27 年的 OpenBSD 老漏洞。
然后 Anthropic 做了三件事,不公开发布模型,搞了个 Project Glasswing,只给亚马逊、苹果、微软等十几家审核过的机构开放,配合美国,6 月起 Fable 5 和 Mythos 5 对所有外国公民直接断供。
美国 Anthropic 的选择是:这个能力太危险,锁进保险柜,钥匙交给政府。
智谱的选择是,两周后,权重公开发布。
一个能力级别接近的漏洞发现引擎,即将以开源形式进入公共领域。
价格几何
编程上 GLM-5.3 是开源阵营最强,但离闭源前沿还有距离。权重两周内发布,GLM-5.3 缩小了与 Anthropic Fable 5 这类榜首模型的差距。
API 已经上线,GLM Coding Plan 用户直接可用,支持 ZCode、Claude Code、OpenCode 这些编程智能体工具。
GLM-5.3 不支持关闭思维链了,只能在 low、high、max 三档之间切,编程任务官方推荐 max 档。
智谱不打算让你牺牲推理深度换速度,它对自己的 RL 训练出的长思考能力有信心。
计费改积分制,非高峰时段(工作日 14:00-18:00 以外,含周末)消耗减半。通过 ZCode 使用还有 98% 以上缓存命中率和限时 1.5 倍额度,叠加相当于标准额度的 180%,活动到 8 月底。
套餐额度:Lite 2,000 积分 /5 小时 + 10,000/ 周;
Pro 12,000/5h + 60,000/ 周;
Max 28,000/5h + 140,000/ 周。
智谱自己算的账:全用 GLM-5.3、按编程场景平均 90.9% 缓存命中率,Lite 每周大约能跑 0.43 – 0.87 亿 token,Pro 约 2.63 亿起。
小结
GLM-5.3 证明了两件事。
预训练不再是唯一战场,后训练的规模军备竞赛才刚开始,而智谱抢到了先手。
网络安全能力的 " 涌现 " 加上两周后的开源发布,意味着 AI 攻防能力的扩散已经不可逆。
•END •
欢迎点击奇偶工作室视频号,看最新视频 ~
↓↓↓
Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
↓↓↓


登录后才可以发布评论哦
打开小程序可以发布评论哦