
智东西
作者 | 毕伟豪
编辑|漠影
智东西 8 月 27 日报道,就在昨晚,火爆全网的神秘" 牛来模型 "被智谱官方认领,是其全新开源的原生多模态模型 GLM-5.3-Flash ( 320B-A18B ) ,支持图片、视频、文件和文本多模态输入。
此前,智谱为收集真实用户反馈,将这款模型以 Ox Alpha 的名称在 OpenCode 和 OpenRouter 上进行了测试,上线首日就登顶了 OpenRouter 调用量榜单,并刷新了单日 tokens 用量历史纪录,被称为 " 牛模王 "。
在匿名期间,曾有谷歌研究员发文暗示 Ox Alpha 可能是 Gemini 的新模型,遭到一众网友的质疑和嘲讽。

虽然不少网友猜测这款模型是智谱的,但很多人并不相信,他们认为双平台上如此高的调用量,不可能是智谱的新模型,原因是 " 智谱没算力 "。

而在官方认领后,我们不得不感慨一句:他们的嘲讽声好大啊。10 万张国产芯片,承载了 GLM-5.3-Flash 模型 1M 超长上下文的多模态推理 , 以及全球超高用量负载,这也是国产芯片首次大规模集体出海。
性能上,GLM-5.3-Flash 在基准测试和真实使用中全面超越了参数量高一倍的 GLM-5.2,在 Artificial Analysis Intelligence Index(AA 综合智能指数)上,GLM-5.3-Flash 分数与 Claude Opus 4.8 持平。

同时,稀疏注意力与线性注意力混合架构的采用,也大幅度降低了 GLM-5.3-Flash 的长上下文服务成本并不失精度。
而全国产卡与混合架构,带来的除了模型能力,还有性价比。GLM-5.3-Flash 的输入价格为 0.8 元 / 百万 tokens,输出为 2.8 元 / 百万 tokens,缓存命中 0.23 元 / 百万 tokens,现实 5 折优惠,缓存存储暂时免费。

作为一款多模态模型,GLM-5.3-Flash 的定价仅为 GLM-5.3 的 1/10、Opus4.8 的 1/40,限时折扣时期为 GLM-5.3 的 1/20,虽然缓存价格不如 DeepSeek-V4-Flash,但从输入和输出的价格以及模型能力的综合比对来看,GLM-5.3-Flash 的性价比要更高一些。

智东西在智谱 ZCode 中深度体验了这款模型,围绕图片识别、办公任务、代码生成、3D 游戏开发,以及视频剪辑等多方面能力进行了实测。
我们不仅测试了它处理日常图片和办公任务的表现,还让它从零复刻了《深海迷航》和《王者荣耀》两款游戏的片段,并为 DeepSeek Harness 打造了一套二次元皮肤。
一、 识图、做题、复刻网站,把吴恩达 48 分钟演讲视频剪成 5 分钟金句合集
我们首先测试了 GLM-5.3-Flash 的基础识图能力,分别将《复仇者联盟 4》海报和拍立得相纸包装盒的照片输入进去,这两张图片可以检验模型的人物识别、小字甄别以及对照片的识别精确度等能力。

能看到 GLM-5.3-Flash 准确地识别出了海报中演员名和对应的人物形象,还标注了火箭浣熊的配音演员。对拍立得包装盒照片的识别也相当准确,判断出了背面是 7 种不同语言的相同安全注意事项警告内容,下方小字也精确识别出来了。
除了简单的识图,我们还测试了 GLM-5.3-Flash 在混乱画面中的识别、理解与推理能力,在 ZCode 中上传了半页有首尾有缺失的公务员考试模拟试卷,让它识别题目并生成答案。上面全是密密麻麻的草稿,印刷油墨、圆珠笔与铅笔字迹混合。

GLM-5.3-Flash 识别出了材料的缺失,然后将完整题目列出来并生成了答案,经过比对发现,依靠半份材料以及照片中的草稿信息,GLM-5.3-Flash 仅答错了一题。

接下来,我们让 GLM-5.3-Flash根据 Hermes Agent 官方网站的艺术风格,做一个智谱 ZCode 的网站,要求复刻风格以及动效。

ZCode 用 GLM-5.3-Flash 抓取了 Hermes Agent 的网站,并提取了设计语言,然后用 JS 代码生成线稿,用时接近 35 分钟,产出网站如下:
整体网站风格和 Hermes Agent 完全一致,但内容替换为了 ZCode,同时页面动效、下拉菜单以及双平台安装卡片都完美复刻。期间 GLM-5.3-Flash 还通过逐区截图核查,修复了光球遮挡标语等问题。

除了识图,我们对其多模态能力的另一个方向非常感兴趣——视频。虽然 GLM-5.3-Flash 不是视频生成模型,但通过多模态处理能力,可以实现视频剪辑功能。
我们上传了一段吴恩达接近 48 分钟的演讲视频,并让 GLM-5.3-Flash 将这个视频剪成金句合集的形式,GLM-5.3-Flash 用时 57 分钟,从整段视频中提取了 17 个金句片段剪辑成片,并配上了中文字幕。

最终 GLM-5.3-Flash 剪好了金句视频,同时还导出了字幕文件,具体片段和转写稿等中间产物保留在了文件夹中。整个视频片段切换流畅,同时字幕准确,音画一致。

二、 复刻《深海迷航》《王者荣耀》游戏片段,给 DSH 做了一个皮肤插件
作为 GLM-5 系列模型,编程能力依然是 GLM-5.3-Flash 的重点,在智谱自研的 Z.ai Code Bench 体感评估中,其编程表现与 Claude Opus 4.8 相当。
智东西在编程方向做了三轮测试,从不同场景和用户角度切入。
首先,我们拟定了一份非常详尽的需求文档,让 GLM-5.3-Flash 开发一款类似《深海迷航》的 3D 游戏,没有提供任何视觉参考。

GLM-5.3-Flash 的多模态能力在游戏编写过程中充分展现,基本代码编写完成后, ZCode 会进入实机测试环节,它调用 GLM-5.3-Flash 在游戏中截图并查看状态,对鱼群受惊、氧气消耗以及探照光等细节进行了检查和调整。

随后,我还让 GLM-5.3-Flash 继续添加第一人称视角和玩家走出潜水艇的玩法,最后呈现出了这个山寨版的《深海迷航》。游戏的流畅程度、物理合理性、氧气消耗以及视角切换等方面完成度非常高。
接下来,为了检验 GLM-5.3-Flash 的视觉能力在游戏开发中能做到什么程度,我们上传了一段《王者荣耀》的训练营实机对战视频,并输入一段非常简短的提示词:
根据这个视频,做一个 PVP 对战游戏,要求还原技能、冷却、扣血机制、伤害机制、移动、技能特效、地图资源、防御塔机制等,网页可操作。

GLM-5.3-Flash 根据视频中公孙离和孙尚香的英雄对战画面,开发了一个 2D 横版 MOBA 游戏,整体机制还原《王者荣耀》,公孙离的 " 换伞 " 和孙尚香的 " 强化普攻 "都在游戏中实现了复刻。
虽然游戏因为提示词细节不足,在一些伤害机制和空 A 以及技能释放设定方面有所缺陷,但整体还是具有可玩性的,也可以看到 GLM-5.3-Flash能够根据视频素材判断游戏基本逻辑,对于一些细节也能够做到还原。
最后,我们让 GLM-5.3-Flash给最近开源圈爆火的 DeepSeek Harness 设计一个皮肤插件,以此测试其在代码理解、编程、图片素材处理以及前端设计等方面的综合能力。
首先我们用图片生成模型创作了一些二次元 UI 素材,然后将其输入到 ZCode 中,让它根据 DeepSeek Harness 的仓库自行设计一个皮肤插件。

GLM-5.3-Flash 详细解读了需求,随后浏览 DeepSeek Harness 的仓库找到了插件设计规范并根据图片素材开发了插件。在我安装后遇到问题时,只需要将报错信息以及具体问题截图发给它,它就会识别问题并进行处理。

最终我的 DeepSeek Harness 拥有了一款非常好看并且不影响交互的皮肤,GLM-5.3-Flash 在修改过程中自动处理了文字遮挡、明暗双色皮肤系统混乱等问题。

三、 长上下文、低成本、多模态,日常办公也在射程之内
GLM-5.3-Flash 的设计架构,从一开始就把成本放在了重要的位置。
GLM-5.3-Flash 总参数量为 320B,与 GLM-4.5 的 355B 相差不大,但激活参数从 32B 降到了 18B,层数也从 92 层减少到 45 层,几乎砍半。
智谱希望在整体参数规模没有明显缩小的情况下,结合最新 30T Token 多模态预训练语料,让模型尽可能少调用计算资源,同时实现更强的性能。
长上下文也是同样的思路,1M 上下文真正难处理的,是注意力带来的计算和存储开销。对此,智谱采用了线性注意力与稀疏注意力的混合架构:线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。
面对超长上下文带来的索引器额外时延和内存占用,智谱进一步引入 IndexPool,把索引器产生的 4 个缓存向量通过加权池化压缩成 1 个,以此减少这部分开销。
从结果来看,优化还是比较明显的。官方数据显示,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低了 3.01 倍,KV 缓存降低 4.44 倍。

在所有基线模型中,GLM-5.3-Flash 的注意力计算量最低。不过在 KV 缓存方面,它目前仍略高于 Kimi-K3 和 DeepSeek-V4-Flash,这也是智谱后续还需要继续优化的地方。
除了编程,GLM-5.3-Flash 在办公方面也不遑多让。其 1M 上下文为长文档场景提供了足够多的底气,同时,多模态能力以及更低的价格让 GLM-5.3-Flash 在日常办公场景也能够胜任。
在办公场景实测中,智东西上传了一篇 58 页的文学硕士论文,让 GLM-5.3-Flash 进行精华提炼。GLM-5.3-Flash 仅用 5 分半就阅读并提取了论文的核心内容,随后生成了精华总结。

面向经营方向,我们上传了几张模拟甜品店经营数据中的图表,让 GLM-5.3-Flash 做一个经营状况分析,然后生成 PPT,这些图片中只有可视化表格信息,并没有文字总结。

GLM-5.3-Flash 通过对图表的分析,制作了一份经营状况分析与策略建议 PPT,其图表并没有直接使用我提供的素材,而是根据自己的分析进行创作,整个 PPT 非常简洁美观,文字也相当准确。
在所有测试的最后,我们针对秋招场景让 GLM-5.3-Flash 搜集并整理一份新闻学秋招求职分析与行动报告,并以 PDF 形式输出。
GLM-5.3-Flash 搜索并整合了多个信源的信息,生成了一份共计 36 页的求职报告,内容非常详尽,包括了今年秋招的变化、新闻学专业就业领域、岗位投递梯度以及简历写法等方面,在文字排版、图表以及配色上的完成质量很高。
整体体验下来,GLM-5.3-Flash 的多模态能力从识别图片、剪辑视频到编程以及日常办公等各项任务都能够胜任,而其相比同水平模型更低的定价,也让这款模型的性价比卷到了一个非常高的地步。
结语:智谱正在用技术和国产芯片,开启一场新型价格战
这次 " 价格战 " 不一样,降价不靠压缩利润,靠的是架构和芯片:混合注意力架构把长上下文推理成本压到极低,国产芯片把算力账单打下来。当降价源于效率而非烧钱,这个价格就能持续下去,与其说是价格战,不如说是定义价格。
对用户而言,换来的是更具性价比的模型:同样的预算能跑的活成倍增加,多模态能力也让 GLM 系列模型从代码开发,延伸到文档处理、金融分析这些日常办公工作流。
技术摊薄成本、国产芯片压低价格、多模态拓宽场景,这套打法跑通之后,冲击的不只是定价体系,还有整个行业对 " 前沿智能必然昂贵 " 的默认想法。


登录后才可以发布评论哦
打开小程序可以发布评论哦