爱范儿 3小时前
实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。

有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro 正式版虚晃一枪后正式发布,多项 benchmark 直指 Fable 5;还有一个不能算旗舰的 Gemini Flash。

然后今天,智谱也把 GLM-5.3 端了上来。

这个在 5.2 期间,一直被调侃「我知道很好用,但不给我开会员用」的顶尖国产编程模型,终于迎来了更新。

新的模型继续在编程方面发力,评测榜单的结果显示,GLM-5.3 在编程能力上比肩 Fable 5 和 GPT-5.6 Sol。在社交媒体上参与内测用户的反馈则提到,使用体感比 Kimi K3、DeepSeek V4-Pro-0813 要更好

能跟 GLM-5.3 上桌对比的模型,在可视化图表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是开源自己一堆模型对比,不找闭源自讨苦吃,现在是「对标 Fable 5」成了开源的基本配置。

六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。

AutomationBench、Agents' Last Exam,一个是用来测试跨应用工作流编排能力,一个是测试智能体能力,GLM-5.3 的成绩也是数一数二。

和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别。官方技术博客中提到,此次升级带来的提升主要原因是后训练 Scaling

就是靠着 743B 的基模,智谱训练出来了 Kimi K3 2.8T 级别的大模型。

我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。

▲ 更完整的 benchmark 对比,经过后训练的 GLM-5.3 对比 GLM-5.2 提升相当明显,Coding、网络安全和 Agentic 成绩进步都不像是一个基座模型。

不得不说,现在大模型做好后训练在某些程度上比预训练都更好使。就拿四月份发布的 DeepSeek V4 Flash 预览版和 7 月底发布的正式版相比,两个模型的能力几乎是断层的。

智谱这次还开源了名为史莱姆 Slime 的一个后训练框架,直接能覆盖发布级模型后训练所需要的完整工作流。他们说从 GLM 4.5 开始,就一直在用这套框架进行后训练

目前 Slime 支持对 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 进行后训练。

▲ 教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏

除了主打编程,GLM-5.3 的另一个重点方向是网络安全。从 Hugging Face 事件开始,现在哪个模型不能谈谈网络安全,都算不上是一个好模型。

无论是模型的攻击能力强,能逃出设置的沙箱,还是防守能力强,能监控、抵御和分析复杂的 AI Zero Day 漏洞;这些以前听着离我们普通用户很远的东西,也成了大模型角力的新赛场。

GLM-5.3 在网络安全相关的任务中,表现与 Claude Mythos 5 持平。其中 ExploitGym 网络安全测试,就是 OpenAI 在评估自己的待发布模型时,为了解决更多问题去攻击了 Hugging Face,GLM-5.3 的表现也非常不错,898 到题,限时 6 小时内完成的情况下,达到了 130 道。

针对模型的网络安全能力,智谱还公开了一项网络安全披露账本,记录模型在不同的项目中找到的各种漏洞。GLM 找到的最古老漏洞,甚至可以追溯到大约 40 年前

40 年都没找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手里,这不比证明了一个数学难题强吗。

▲ 网络安全披露账本 https://cvd.z.ai/

虽然我们普通用户不会拿它去找各种攻防漏洞,但模型的能力提升是实打实的,具体到日常的办公和编程任务上,GLM-5.3 的表现又如何。

APPSO 提前拿到了 GLM-5.3 的测试资格,继续用一些 3D 网页生成、网页应用开发、macOS 小工具开发等任务,来看看 GLM-5.3 的表现是否能快速实现我们的想法。

目前 GLM-5.3 已经上线智谱官方 Agent 应用 Zcode 和效率工具 AutoClaw,同时面向 GLM Coding Plan 用户全量开放并开放订阅。

▲ 在 Zcode 应用内可以直接选择 GLM-5.3 进行体验

第三方平台像是 WorkBuddy,QwenWork,TraeWork 等应用也已经开放抢先体验。而 API 调用预计在下周二开放,模型的完整权重则会在两周内开源。

当所有 AI 都开始卷编程

相较于写作或者文科领域,那些见仁见智,审美无法统一的任务,编程大概是大模型最适合发力的场景。

简单粗暴的一句提示词丢进去,就等着看它用代码能写出什么好看好玩有意思的画面。

我们先是让它做了一个人体血液循环的 3D 交互仿真系统,原以为它会做一个写实的人体透视,至少像是这种细节满满的 3D 仿真,有真实的身体轮廓,合理排放的血管,真实的肌肉线条。

但不知道是不是提示词不够详细,GLM-5.3 给的交付是看起来比较粗糙的版本。整个人更像是一个火柴人,内部器官也全部堆在了一起。

比较难得的是,整个的演示有较多的自定义,例如视图图层可以选择不同的场景,生理参数也有心率、压力等内容。我们甚至可以选择失血性休克的场景,直接看到血液循环的流向。

▲ 提示词:做一个高精度的人体血压循环 3D 可交互仿真系统,使用 GLM-5.3 + Claude Code

总的来说,这个交互网页能够用在教学场景,但就是没有那么好看。

继续我们在 DeepSeek Harness 中的金字塔滑板游戏测试,同样的提示词,GLM-5.3 + Claude Code 最高推理深度给出的结果也不赖——游戏体验好,场景渲染也准确。

▲ 如果你不好好操作,可能真的会输,只是这个滑板的残影,过于「亮眼」。

当我们想要它生成一些惊艳的 3D 场景时,像是一个满是水母的湖,数百万只写实的水母在一片翡翠湖泊里飘动。

这个效果确实还挺漂亮的,渲染水母就不会像渲染人体一样,只用一些简单的圆圈,不过这个 3D 水母的提示词也相当长。

在 Claude Code 中使用 GLM-5.3 时,如果你开启了自动审批命令,会经常遇到一个错误,显示「auto mode cannot determine thesafety of Bash right now.」即「自动模式目前无法判断 Bash 命令的安全性。」

这大概是 Claude Code 应用自身的机制来处理自动模式下,如何识别不同的命令是否需要弹窗通知交给我选择,但第三方的模型,暂时还没有适配 Claude Code。

于是我们切换到 ZCode 进行体验,它能像 Codex 一样使用不同的工具,不断对已经生成的网页截图识屏,分析存在的问题,然后持续优化,整个运行时间也比单纯在 Claude Code 中使用会更久。

就像这个行星撞地球的模拟,两个行星碰撞,我们在 Claude Code 中的任务最长没有超过 1h,但这个 3D 网页过了一个小时,ZCode 还在反复地测试检查。

好在最后的效果没有让人失望,我们第一眼就能看到地壳开裂、熔岩喷出、碎片形成行星环等壮观画面。就这些复杂的粒子运动,要面面俱到的编程好,肯定是需要一点模型底子的。

同尺寸里的最强模型

GLM-5.3 的意义,我们测试下来就觉得它还是回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。

K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。

所以如果你本来就在用智谱,已经购买了 Coding Plan(今天下午他们也重置了一次),从六月中旬发布的 GLM-5.2 切换到 5.3,是能感受到比较明显的差异。

虽然 API 版本预计要等到下周二更新,目前官网显示的 API 价格也还是 GLM-5.2 版本,但同样的模型尺寸,估计 GLM-5.3 的 API 定价不会有太大的变化。

Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型发布节奏几乎是前所未有,每天都有新的模型,新的工具可以测试。

模型之间的区别也随着密集的发布逐渐在缩小。拿我们自己来说,曾经 Claude 被认为是写作上最好用的模型,优化一些句子的结构,把脑子里乱成一团的想法让它有逻辑的串联起来,Claude 给的文章有时比人类写得还要好。

但频繁封号的 Claude,让我们转到了用 GPT 以及其他的模型,于是发现好像所谓的 Fable 5 和 Opus 5 并不是那么的非它不可。

写作如此,编程、生图、整理文档、做报告、构建知识库也越来越接近这个状态。

GLM-5.3 和最近这一连串新模型一起,把大模型的「最强保质期」压得越来越短。

新发布的 GLM 用了 20 天,就有更强更好的 Kimi,Kimi 用了 20 天,又能换到新发布的 DeepSeek,等 DeepSeek 不好用了,那个时候又可以轮到 GLM 了。

所以当别人问你,现在最好的国产编程模型是什么,你会说 Kimi K3、DeepSeek V4 还是 GLM 5.3?

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

马斯克 编程 开源 网络安全
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论