《科创板日报》8 月 15 日讯(记者 李明明)国产开源大模型的牌桌上,又落下一张新牌。
8 月 14 日,智谱亮出自己的最新答卷——新一代基座模型 GLM-5.3 正式发布。
《科创板日报》记者获悉,该模型总参数规模 7430 亿,主要通过后训练实现能力跃升,在代码与网络安全两个方向上的表现 " 超出立项时预期 ":代码能力居开源模型第一,对齐最强闭源模型 Claude Fable 5;在白盒代码审查与漏洞推理等基础安全任务中超过 Mythos 5。
值得一提的是,近期全球大模型新品密集迭代、上新节奏明显提速。北京时间 8 月 13 日凌晨,DeepSeek 正式发布 V4 Pro(DeepSeek-V4-Pro-0813)并上线 API,新版本重点强化 Agent 智能体能力。
稍早前,马斯克旗下 xAI 刚刚发布 Grok 4.6,叠加此前亮相的 Kimi K3、阿里通义千问新一代旗舰版本,国内外厂商集中加码复杂任务、工具调用方向,大模型赛道竞争进一步升温。
实测 GLM-5.3
智谱相关人士对《科创板日报》记者称,与 GLM-5.2 相比,基座模型没变,但通过后训练 Scaling 实现编程能力 50% 提升,出现了超出预期的模型能力。
相关数据显示,在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3(Kimi K3 为 17.4);在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9(K3 为 67.5);在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5(K3 为 27.6);在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1769(K3 为 1682),展现出基于编程的专业任务执行能力。
GLM-5.3 没有改动基座模型,完全依靠放大后训练规模就实现编程能力 50% 提升,在多个开源编程基准冲到第一。后训练 Scaling 是否已经成为大模型迭代的新主流路线?
赛迪顾问人工智能与大数据研究中心分析师白润轩对《科创板日报》记者分析,后训练 Scaling 正在成为大模型迭代的关键路线,这个判断在 GLM-5.3 上得到了比较清晰的验证。基座模型继续堆算力的边际收益在收窄,行业内已经开始把更多资源投入到强化学习、长程任务环境和可验证奖励机制上,而不是一味追求参数规模扩张。GLM-5.3 基座没变,靠扩大后训练规模把编程能力往上拉了一个台阶,说明基座之上还有可观的智能空间可以被激活,这条路在工程上是成立的。
谈及这种能力暴涨是否为基准测试的 " 刷分效应 ",他判断,这种路线和单纯刷榜有本质区别。刷榜依赖的是静态数据集和固定评测指标,模型可以从人类偏好里学习对齐技巧来提高分数。而 GLM-5.3 的后训练依赖的是真实可执行的代码环境,模型必须在终端里跑测试、看报错、反复修改,训练信号来自任务是否真正完成。所以它的能力根基更接近真实软件工程场景,而不是对评测题目的模式匹配。GLM-5.3 把后训练从调对话风格推进到了解决长链路工程问题这个层面,方向本身是真实的,但具体迁移效果还要看后续在真实开发工作流里的稳定性、成本效率,以及面对非标准化需求时的泛化能力。
《科创板日报》记者第一时间对 GLM-5.3 进行了数小时连续实测,检验其在复杂 3D 工程全链路任务上的端到端生成能力。记者要求模型以资深 Three.js 工程师兼分镜师的身份,从零交付一套完整产物:既要在浏览器中实现可交互的第三人称明亮风格开放世界 Web Demo,还要复用同一场景资源离线逐帧渲染出 60fps 电影感宣传片,全程仅提供设计规格、素材清单与验收标准,所有代码完全由模型自主编写,此外,还要求做一个 3D 小游戏大闹天宫游戏的开发生成。
经过半小时左右的运行,GLM-5.3 顺利完成了全流程任务输出,既生成了可直接在浏览器中加载运行的开放世界交互 Demo 代码,也同步产出了适配 60fps 帧率的电影感宣传片渲染脚本,整套交付物几乎无需人工二次调整即可落地运行,直观展现了其在复杂 3D 工程全链路任务上的端到端生成能力。


押注下一个场景
智谱在网络安全这条赛道上的布局,并非临时起意。据智谱方面对《科创板日报》记者介绍,其 2025 年 9 月就启动了网络安全方向研究,在 GLM-5.2、GLM-5.3 研发期间持续加码:搭建更多长程任务环境、更丰富的环境类型,并与国内安全实验室进行更专业的 harness 共创。
在 CyberGym 测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%,也略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。
《科创板日报》记者获悉,GLM-5.3 发布前两周,智谱联合清华、南开及多家头部安全团队开展密集红队测试,累计发现漏洞 2404 个,其中中高危 1088 个,覆盖 220 个项目,部分成果获微软致谢并进入 CNVD、CNNVD 官方披露流程。开放上先完成安全加固,限制潜在攻击能力、保留防御价值,核心敏感能力仅向受信验证用户开放,第三方评估确认其防御能力较强、漏洞利用难度高。
智谱为什么选择在这个节点重点投入网络安全方向?白润轩认为,网络安全是 AI 能力落地最刚性的场景之一,智谱在这个节点选择重投,看到的是供给严重不足和合规压力持续加大的双重需求。企业代码量爆炸式增长,防守方长期处于人力劣势。很多企业的安全团队规模有限,与此同时,数据安全法、关键信息基础设施保护条例等监管要求趋严,企业必须把安全审计嵌入开发流程,不能再靠事后补救,合规驱动的需求正在从金融、电信向政务、能源、医疗等领域快速扩散。
白润轩判断,智谱从 2025 年就开始布局这个方向,与国内头部安全实验室共建任务环境和评测框架,说明它不只是把安全当作模型能力的副产品,而是当作一个可商业化的垂直入口。未来安全能力很可能成为大模型在 B 端落地的重要抓手,尤其是在金融、电信、政务、能源这些对合规和攻防高度敏感的领域,AI 驱动的自动化安全审计和漏洞挖掘有望填补人力缺口,改变攻防不对称的格局。
把镜头拉远,这是一盘更大的棋。基础模型能力日渐趋同之后,对基础模型公司而言,下一阶段的竞争不仅是模型能力之争,更是高价值场景之争。
一个值得注意的行业信号是:全球头部 AI 公司正在不约而同地把网络安全能力摆上货架。今年 4 月,Anthropic 发布以安全能力为卖点的 Claude Mythos,仅向约 150 家大型机构提供服务——安全能力被直接标价为面向大客户的商品;OpenAI 则让模型专攻网络攻防评测,其 " 越狱 " 事件恰恰发生在这一过程中。
Gartner 官方预测,2025 年全球信息安全支出达 2130 亿美元,2026 年将增至 2400 亿美元,其中安全软件增长最快,人工智能被列为支出增长的主要驱动因素。
能力的落点,最终指向商业化。Coding Agent、安全审计、企业服务,都可能成为基础模型公司下一阶段商业化的重要入口。
据介绍,智谱已同步上线官方编程工具 ZCode、效率工具 AutoClaw 及 GLM Coding Plan 订阅服务,API 很快上线,完整模型权重计划两周内开源。
(科创板日报记者 李明明)


登录后才可以发布评论哦
打开小程序可以发布评论哦