北极星电力网 17小时前
智谱GLM5.3发布,开源编程第一!还挖出了40年陈年老bug
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者 | 汤安迪

编辑 | 周欢

昨天梁文锋又变成了梁白开。

然后轮到智谱创始人唐杰登场了!

在 8 月 14 日,智谱推出了新模型 GLM-5.3。

Z.ai 的全球业务负责人李子玄基座模型和 GLM-5.2 共用同一个底座。

所有能力提升,全部来自后训练阶段的强化学习。

然后现在也有人给他做图了。

Terminal Bench 3.0,从 4.6 分直接跳到 28.3 分。

没有新基座,没有新架构,就是硬堆 RL。

智谱在官方博客里的原话是:Scaling post-training is all we did。

预训练的红利还没吃完?不,是后训练的红利你们根本没开始吃。

不换底座,只堆训练

智谱在 GLM-5.2 时期搭好了三根柱子,IndexShare 负责长上下文,SAO 负责长周期任务的 RL 算法,开源的 slime 框架负责大规模异步训练。

GLM-5.3 的做法简单粗,在这套栈上继续堆。

更多环境、更多样的任务、更多训练算力。

重点在环境。

新的训练环境不再是编程练习题,而是模拟资深工程师的真实工作现场。

有些任务的体量,相当于一个有经验的工程师要干好几天的活,比如在完整的 ML 基础设施里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。

智谱造了一条自动合成环境的流水线,研究智能体从真实工作里提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。

然后就有了:

编程开源第一。

GLM-5.3 是目前开放权重模型里编程最强的,没有之一。离闭源前沿还有一截。

Terminal Bench 3.0:GLM-5.3 拿 28.3,开源阵营第一,但 GPT-5.6 Sol 是 34.6,Fable 5 是 33.7。

DeepSWE v1.1:66.9,还是输给 GPT-5.6 Sol 的 72.7 和 Fable 5 的 69.7。

Agents' Last Exam 拿到 28.5,这个项目上倒是逼平了全场。

所以智谱在编程这件事上,开源第一,全局第二梯队头部。

意外

网络安全能力 " 涌现 " 了

智谱在后训练里加了漏洞发现相关的数据和环境,本来只预期模型 " 找漏洞更准一点 "。结果模型直接越过预期,开始自主规划完整的漏洞利用链条。

数字非常硬。

CyberGym(白盒源码审计):84.5%,全场第一,压过 Fable 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。

GLM-5.3 赢过所有闭源旗舰的项目!

ExploitBench(真实漏洞的深层利用推理):从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。

ExploitGym(限时完成漏洞利用任务):从 29/39 涨到 105/130。

越靠近攻击链的后端,涨得越凶。找漏洞是防守方技能,写利用链是进攻方技能,GLM-5.3 这个模型在进攻端的进化速度,比防守端快得多。

智谱自己用了 " 涌现 "(emergent)这个词:能力不是专门训出来的,是扩大 RL 规模时自然冒出来的。

官方称,从 GLM-5.2 开始就与国内安全团队合作,用模型扫描真实代码库。

经专家审核去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个中高危。覆盖操作系统内核、浏览器引擎、网络协议这些核心基础设施,有些漏洞在代码里藏了几十年,最老的一个据智谱称可追溯到约 40 年前。

这可能会成为 AI 安全领域今年最值得警惕的信号之一。

因为 " 涌现 " 意味着,任何一家把 RL 规模堆到同一量级的实验室,都可能一觉醒来发现自己手里多了一个网络武器。

和 Anthropic

不一样

目前 53 个漏洞已公开披露,2,383 个还在保密期。智谱上线了一个公开的漏洞披露追踪页面,持续更新进度。

这套打法眼熟吗?

今年 4 月,Anthropic 的 Claude Mythos 走了几乎同一条路,自主发现数千个零日漏洞, Mozilla 用它在一个浏览器版本里就扫出 271 个,还有藏了 27 年的 OpenBSD 老漏洞。

然后 Anthropic 做了三件事,不公开发布模型,搞了个 Project Glasswing,只给亚马逊、苹果、微软等十几家审核过的机构开放,配合美国,6 月起 Fable 5 和 Mythos 5 对所有外国公民直接断供。

美国 Anthropic 的选择是:这个能力太危险,锁进保险柜,钥匙交给政府。

智谱的选择是,两周后,权重公开发布。

一个能力级别接近的漏洞发现引擎,即将以开源形式进入公共领域。

价格几何

编程上 GLM-5.3 是开源阵营最强,但离闭源前沿还有距离。权重两周内发布,GLM-5.3 缩小了与 Anthropic Fable 5 这类榜首模型的差距。

API 已经上线,GLM Coding Plan 用户直接可用,支持 ZCode、Claude Code、OpenCode 这些编程智能体工具。

GLM-5.3 不支持关闭思维链了,只能在 low、high、max 三档之间切,编程任务官方推荐 max 档。

智谱不打算让你牺牲推理深度换速度,它对自己的 RL 训练出的长思考能力有信心。

计费改积分制,非高峰时段(工作日 14:00-18:00 以外,含周末)消耗减半。通过 ZCode 使用还有 98% 以上缓存命中率和限时 1.5 倍额度,叠加相当于标准额度的 180%,活动到 8 月底。

套餐额度:Lite 2,000 积分 /5 小时 + 10,000/ 周;

Pro 12,000/5h + 60,000/ 周;

Max 28,000/5h + 140,000/ 周。

智谱自己算的账:全用 GLM-5.3、按编程场景平均 90.9% 缓存命中率,Lite 每周大约能跑 0.43 – 0.87 亿 token,Pro 约 2.63 亿起。

小结

GLM-5.3 证明了两件事。

预训练不再是唯一战场,后训练的规模军备竞赛才刚开始,而智谱抢到了先手。

网络安全能力的 " 涌现 " 加上两周后的开源发布,意味着 AI 攻防能力的扩散已经不可逆。

END •

欢迎点击奇偶工作室视频号,看最新视频 ~

Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

↓↓↓

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

创始人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论