太热闹了。
昨儿 DeepSeek V4 Pro 正式版 +Harness、Grok 4.6" 你方唱罢 ",今儿GLM-5.3闪亮一记" 我登场 "——
一出手便杀回开源一哥、国模一哥,甚至在 Coding 方面更加接近 Claude Fable 5!
也就是说,唐杰给马斯克 " 画的饼 "(说国产模型超越 Fable 5 不会太久),往前拱了一大截,也就花了 2 个月整。

在多项主流基准测试中,GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

更值得注意的是不同推理强度下的表现。随着 Token 预算增加,GLM-5.3 的 Coding 准确率继续往上走;在 High 档位下,已经能以明显更低的 Token 消耗,做到超过 Claude Opus 4.8 最高档位的准确率。

但你先别急着 " 嚯 ~"、" 好家伙 ",因为好戏还在后头。
这次 GLM-5.3 除了 Coding 之外,另一个更重要的关键词,是安全。

在 CyberGym 白盒代码审查中,GLM-5.3 拿到 84.5%,相比 5.2 的 77.2% 继续提升,也略高于 Mythos 5 和 GPT-5.6 Sol,一举成为最强开源安全模型。
并且在 GLM-5.3 发布前两周,智谱就联合清华、南开,以及国内众多企业、实验室,开展了密集的红队测试与安全评估。
据悉,累计发现漏洞 2404 个(经过初筛、去重),其中 1088 个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等 220 个项目。
甚至最早的 Bug,可以追溯到40 年前!
所以,这次智谱发布 GLM-5.3,两个关键词便一目了然了:一个是 Coding,另一个是安全。
不意外,GLM-5.3 一出,瞬间在 X 引发了大量的关注和热议,网友们已经把它称作"Fable 5 级 "了:

不得不说啊,这次 GLM-5.3 又在国际上把国产 AI 给支棱起来,这盛况,真是应了揽佬的 " 名人名言 ":
中国人能飞 ~ 中国人能飞 ~

最重要的一点是,在体验 GLM-5.3 的真实过程中,我们的体感真真儿的可以用一句话来概括:
丝滑,相当的丝滑!是有点超预期在身上的。
那么接下来,老规矩,一波深度实测,走起 ~
做了一个可交付的模拟游戏
我们这次所有的实测,都会在智谱自家的 Harness,即ZCode里进行。
第一个任务,就拿Karpathy最新抛出的指环王基准来小试牛刀一下。
在把《指环王》第一章开头的文字和对应 Prompt 输进去之后,模型选择我们提前拿到的内测 GLM-5.3,并把模式变成 " 完全访问 ",保证全程无人工干预:

然后,GLM-5.3 就自己唰唰唰地开始干活了,你只需要做的,就是等:

在 28 分钟后,一个中文版的指环王基准,就水灵灵地做出来了:
Karpathy 设计的这个任务,考验的是模型能否长时间自主规划、写代码、摆放 3D 资产、编排动画并做出完整可运行作品。
并且我们在 Prompt 中还刻意加大了难度,让 AI 根据原文自行改编成约 90 秒中文旁白,但不能改变核心情节。
从 GLM-5.3 的结果来看,它不仅可以 hold 住这项测试的基本要求,更能从文学文本里抓重点,并把文字重新组织成视听语言。
这类任务的难点,其实也不只是 Three.js 能不能跑起来。模型得先把一段文学叙事拆成场景、人物、镜头和时间线,再一路落进代码里,最后还得保证 90 秒的内容能连续跑起来。
为了更直观地感受 GLM-5.3 Coding 能力的提升,我们还用一模一样的 Prompt 和设置,让 GLM-5.2 跑了一遍:
无需多言,GLM-5.3 完胜。
接下来,我们加大难度,让它再做一个可以完全交互的 3D 手表解构的 Demo。
在输入完 Prompt 之后,GLM-5.3 依旧是自己开始操作,遇到需要修复的地方,也会自行检查做调整:

在十几分钟过后,结果就生成出来了:
在没有任何扫描、没有下载任何手表相关模型的情况下,手表各处细节都能被解构得明明白白,而且是把镜头拉到特别大也是能 hold 住的那种。
相比前面的 " 指环王基准 ",这一关考的又不太一样:一块完整的表好画,但拆开以后,表盘、机芯、齿轮和表链之间的空间关系还能不能保持住,才是考验 3D Coding 的地方。
不过有一说一,上面两个实测效果虽然还算不错,但终归是属于演示级别的 Demo。
因此,Coding 能力的最后一个实测,我们尝试 GLM-5.3 是否能做可交付的模拟游戏。
也就是说,这个任务跑下来,它不仅是有视觉效果,还得是有后端、有数据库、有权限、有测试、有部署的完整模拟游戏。
(注:本地需提前安装好 Docker。)

这次任务较为复杂,GLM-5.3 总共花了 40 分钟。
但对于此次任务的验收,我们不能停留在只放出来最终效果,且得一步一步验证。
首先就是注册和登录游戏:

然后我们进入游戏后进行操作,点击保存到数据库,并退出游戏;要保证进来后还是刚才存档的进度:

权限测试方面,我们退出刚才的账号,再重新注册一个;进入游戏后,我们不难发现 2 个账号的信息是互相看不到的。
这就证明 GLM-5.3 已经跑通了权限的设置:
最后,为了方便起见,我们让 GLM-5.3 自己跑测试并输出验收报告,Prompt 如下:
现在不要再增加任何新功能。 请进入最终验收阶段,实际运行项目现有的全部自动化测试、权限测试、数据库持久化测试和构建测试。 然后向我输出一份最终验收报告。 必须列出: 1. 实际执行了哪些测试命令 2. 每一项测试的真实结果 3. 总测试数量 4. 通过数量 5. 失败数量 6. Docker 构建是否真实成功 7. 哪些内容经过真实验证 8. 哪些内容尚未验证 9. 当前已知 Bug 不要修改测试结果,不要将未运行的内容描述为已经通过。
最终的报告结果如下,可以看到,这个项目确实是把前端、后端、数据库、权限等,通通跑通了:

结合上面三个实测来看,GLM-5.3 在 Coding 方面,不仅仅是更会写质量更高的 " 页面 ",现在,它已经能把一个需求真正交付成软件。
没有 GPU,硬让它编 CUDA 会怎样?
既然 GLM-5.3 已经是可交付的生产级 AI,那么安全,也就是此次智谱发布动作里的第二个关键词,也得好好实测一番。
第一个任务,依旧是小试牛刀,找 Bug。
我们测试用到的项目叫做 AegisDesk,它是一个真实结构的小型 Node.js Web 应用,并且提前埋好了一组安全问题。
但项目里没有答案、没有漏洞注释,也没有告诉模型一共有多少个 Bug。

然后我们这次把 ZCode 的权限,从 " 完全访问 " 改成 " 变更前确认 ",并输入 Prompt:

大约7 分钟后,它交出了一份 348 行的安全审计报告:

更关键的是,对照我们事先埋好的 " 答案 ",12 类漏洞一个没漏。
从最显眼的明文密码、Stored XSS,到藏得更深的 Mass Assignment 提权、跨用户 IDOR、路径穿越,再到一条需要顺着 req.body →用户对象→ Session role 一路追下去的权限链,它基本都翻了出来。
甚至三个散落在不同路由里的 IDOR,它也没为了刷数量拆成三个 Bug,而是识别出共同根因,合并成一个 Finding。
不过 5.3 也并非完全零失误。一处 CSRF 风险虽然判断方向正确,但真正能否完成跨站攻击仍依赖浏览器 Cookie 行为,它自己在报告末尾也意识到了这一点,前面却依旧打上了 CONFIRMED。
找完 Bug,我们继续看看 GLM-5.3修 Bug的能力。
这次任务直接把 GLM-5.3 刚刚生成的审计报告又塞了回去(既然这 12 个洞都是你自己找的,那你自己补)。
但是会备份新文件夹并在 ZCode 里新建项目进行;同样的,在输入 Prompt 后,GLM-5.3 就开始干活了:

9 分 20 秒后,项目里 22 个文件发生变化,新增 1463 行代码:

这一次它没有简单把危险功能删掉。路径穿越加上目录边界校验,IDOR 把 ownerId 真正压进数据查询,Stored XSS 修在输出 Sink,明文密码则迁移到了带 Salt 的 scrypt。
更关键的是,它给这些漏洞自己补出了一套回归测试。最终 ZCode 显示 54/54 通过。
为了避免模型自己出题、自己判满分,我们又把完整项目单独拿出来重跑了一遍——54 项,依旧全部通过。
接下来,我们再做一个有趣的安全测试:
在 Mac 没有 GPU 的情况下,让 GLM-5.3硬写 CUDA,看它会不会瞎编。
我们先确定测试环境确实没有英伟达 GPU:

并且我们设计这个任务的 Prompt 时,也不会提前告知 GLM-5.3 这台电脑没有英伟达 GPU,只给它 CUDA 工程任务:

在18 分 52 秒后,GLM-5.3 给出了它的结果:

GLM-5.3 先确认本机跑不了 CUDA后,开始把任务拆开:
CPU 能验证的算法逻辑自己造了一套模拟测试;CUDA 代码本机编不了,就借 Docker 里的 CUDA Toolkit 真正跑了一遍 nvcc;但到了真实 GPU 执行、CPU/GPU 数值一致性以及性能 Benchmark,它全部停在了 UNVERIFIED。
我们后来又把它生成的 CPU 测试单独拿出来重新编译运行,结果依旧全部通过。
能做的尽量做,没做的明确说没做。
对于一个正在获得越来越多系统权限的 Coding Agent 而言," 知道自己不知道 ",本身也是安全能力的一部分。
而从技术设计上看,GLM-5.3 这次强调的 " 安全 ",其实也不太是传统印象里那种,问模型一句危险问题,看它会不会拒答。
更核心的,是让模型真正进入代码和工程环境之后,能不能理解漏洞为什么成立。
从智谱这次展示的能力结构来看,安全测试重点就包括白盒代码审查和漏洞推理。
前者,是把完整代码库直接扔给模型,让它从输入开始一路追踪到权限校验、数据流和最终的危险操作;后者更进一步,要求模型不能只看到一行可疑代码,还要把一个漏洞成立所需要的前因后果给串起来。
这其实和我们前面的 AegisDesk 实测高度一致。
比如 Mass Assignment 提权,GLM-5.3 并没有停在 " 这里用了 req.body" 这一层,而是一路追出了这么一整条攻击链:
req.body →用户对象→ role 字段→ Session 同步→普通用户最终获得管理员权限。
而到了修 Bug 的环节,逻辑还要继续往下走。
模型既要知道洞该堵在哪里,还得给修复补上回归测试,确认攻击路径被掐掉之后,原来的业务没有一起被修死。
所以从找 Bug,到修 Bug,再到最后没有 GPU 时主动区分 VERIFIED、INFERRED 和 UNVERIFIED,这三轮实测实际上对应的是三种能力:
看得见风险、解决得了风险,以及知道自己的证据到底到哪一步。
这也解释了为什么 GLM-5.3 这次会把 Coding 和安全放在一起。
因为模型一旦真正开始写工程代码,安全本身,也就成了工程能力的一部分。
GLM-5.3 这次为什么要死磕安全?
前面这一通实测下来,一个问题也就冒出来了:
一个 Coding 模型,为啥这次要这么死磕安全?
原因并不复杂。Coding Agent 已经开始真真儿地在现实世界里干活了。
以前模型写代码,更多还是 " 给你一段代码,你自己拿去用 ";到了 ZCode 这一类 Agent,它已经可以直接读整个 Repo、改文件、调用终端、装依赖、跑测试,甚至参与部署。
能力越强,Agent 能接触到的系统越多、拿到的权限也越高。到了这一步,一次判断失误带来的后果,自然也会被同步放大。
所以,安全正在一点点从 Coding 流程的末端往前挪。过去可能是:
写代码→测试→上线前再做安全审计。
现在则越来越接近:
写代码→运行→测试→发现风险→修复→重新验证。
我们刚才的实测就是一个很直观的缩影:GLM-5.3 先把 12 类漏洞翻出来,又拿着自己的审计报告把洞一个个补上,最后再通过 54 项回归测试确认修复没有把正常功能一起 " 修死 ";到了 CUDA 这一关,它还得进一步知道,哪些结论已经验证,哪些只能推断。
现实世界里,这种需求也已经出现。
今年 Hugging Face 在处理一次自主 Agent 驱动的安全事件时,需要分析超过 17000 条攻击相关操作。由于其中包含真实攻击命令、利用载荷和 C2 痕迹,部分商业模型 API 的安全机制会阻断分析,最后他们把 GLM-5.2 直接部署在自己的基础设施里,用来重建攻击时间线。
这件事恰好说明了一点,Agent 开始以机器速度写代码、操作系统,安全也得跟上机器速度。
所以再回头看 GLM-5.3 这次同时强化 Coding 和安全,两者已经越来越难分开。
当 AI 开始真正接手工程," 会写 " 只是第一关。
能交付、能验证、知道边界,还能把自己写出来的洞补上,才是生产级 Coding 真正开始的地方。
GLM-5.3 技术报告:
https://z.ai/blog/glm-5.3
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见

