(来源:AI 信息 Gap)
DeepSeek V4 Pro,8 月 13 日正式发布,9 月 14 日即将下线。享年 32 天。
而干掉 V4 Pro 的,正是 DeepSeek 自家刚刚发布的 DeepSeek V4.1 Flash。
「V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,9 月 14 日起所有 Pro 的 API 请求将自动切换到 Flash,并按 Flash 的价格计费。」
有意思的是,在 DeepSeek V4.1 Flash 之前,另一个 Flash 国模也曾一度爆火。
8 月 20 日,智谱悄悄在 OpenRouter 和 OpenCode 上线了一个匿名模型,代号 Ox-Alpha,中文名「牛来」。Ox-Alpha 首日就冲上了 OpenRouter 榜首,刷新了平台单日 token 调用量历史纪录,还终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录。8 月 26 日,智谱官宣认领了这头牛,Ox-Alpha 的真身是 GLM-5.3-Flash。
Flash,已经不再是单纯的「小杯」了。
—
DeepSeek V4.1 Flash vs GLM-5.3-Flash
先来总结一波。
| DeepSeek V4.1 Flash | GLM-5.3-Flash | |
|---|---|---|
发布日期 | 2026-09-10 | 2026-08-26 |
总参数量 | 552B | 320B |
激活参数 | 输入 8B / 输出 16B | 18B(输入输出对称) |
架构 | MoE + CED(因果编码 - 解码器) | MoE + 稀疏 / 线性注意力混合 |
上下文窗口 | 100 万 tokens | |
原生多模态 | 文本 + 图片 | 文本 + 图片 + 视频 + 文件 |
预训练数据 | 45 万亿 tokens | 30 万亿 tokens |
开源协议 | MIT | |
推理力度调节 | 连续可调 1-100 | 三档(low / high / max) |
DeepSeek V4.1 Flash 和 GLM-5.3-Flash,太像了。
MoE 架构,100 万 tokens 上下文,原生多模态,MIT 协议开源,连推理力度都同样可调节。
但技术架构不同。DeepSeek V4.1 Flash 走了一条非对称路线,输入端只激活 8B 参数,输出端激活 16B。读比写便宜,专为 Agent 场景设计,因为 Agent 要读大量上下文和工具调用结果,输入量远大于输出量。智谱走的是对称路线,输入输出都激活 18B,总参数从 GLM-5.3 的 753B 砍到了 320B。
GLM-5.3-Flash 的多模态更完整,文件和视频输入都支持。
不同的技术路线
DeepSeek V4.1 Flash 和 GLM-5.3-Flash 本质上都在解决同一个问题,「KV Cache 太贵。」
运行 Agent 时,模型每处理一个 token 都要在显存里存一组缓存数据,上下文越长这笔计算开销越大。Pro 模型的 KV Cache 成本可能比推理计算本身还高。所以,Flash 的核心任务就是尽可能降低这部分算力成本。
DeepSeek V4.1 Flash 采用了一个名为 CED 的新架构,全称 Causal Encoder-Decoder。它把 40 层 Transformer 拆分为上下两部分,前 20 层是编码器,负责读入上下文;后 20 层是解码器,负责生成输出。编码器处理输入时只激活 8B 参数,解码器生成输出时激活 16B。
重点在于如何压缩 KV Cache。解码器的全局缓存直接从编码器最后一层的输出里投影过来,不再自己逐层计算。再加上 FP4 量化和跨层共享索引,每个 token 的全局 KV Cache 从上一代的 3514 字节压缩到了 890 字节。
GLM-5.3-Flash 则走了混合注意力路线。45 层神经网络里,34 层是线性注意力,11 层是稀疏注意力,按三比一的节奏交替排列。
线性注意力用递归机制处理局部依赖,计算量随上下文长度线性增长而不是平方增长,天然适合长上下文。稀疏注意力自带一个轻量索引器,负责从 100 万 token 的全局上下文里精准召回关键信息。
为了进一步压缩成本,智谱还引入了一个叫做 IndexPool 的设计,把索引器的 4 个缓存向量通过加权池化压缩成 1 个。最终,GLM-5.3-Flash 和 GLM-5.3 旗舰版相比,注意力计算量降低了 3 倍,KV Cache 占用降低了 4.4 倍。
技术路线不同,但都是为了省算力。
价格,谁更划算?
DeepSeek 按照峰谷定价,智谱统一价。下面的价格都是人民币。
项目(元 / 百万 token) | V4.1 Flash (空闲) | V4.1 Flash (高峰) | GLM-5.3-Flash |
|---|---|---|---|
缓存命中输入 | 0.02 | 0.04 | 0.23 |
普通输入 | 1.0 | 2.0 | 0.8 |
输出 | 4.0 | 8.0 | 2.8 |
缓存命中,经过这次降价后的 DeepSeek V4.1 Flash 便宜得夸张,闲时 2 分钱,智谱 2 毛 3。缓存命中是 API 调用成本里的大头,这是你最应该关注的部分。
普通输入和输出两项,GLM-5.3-Flash 反而更便宜。普通输入 0.8 元 vs DeepSeek 闲时 1 元,输出 2.8 元 vs 4 元。高峰时段 DeepSeek 翻倍之后差距就更大了,输出价格 2.8 元 vs 8 元。
如果单纯调用 API,DeepSeek V4.1 Flash 大概率更划算。
还有但是。但智谱有 Coding Plan,月付 118 元(Lite)、538 元(Pro)和 1078 元(Max)。DeepSeek 只有按量付费的 API,没有订阅套餐。
Coding Plan 更省心,不用考虑闲时忙时,时不时再来个重置,那就更爽了。
token 速度,谁更快?
速度差异明显,DeepSeek V4.1 Flash 太快了。
根据网友们和我自己的实测数据,DeepSeek V4.1 Flash 的输出速度在 284 到 507 tokens/ 秒之间,最高甚至突破了 500,即使加上思考时间也能维持在 300 左右。
GLM-5.3-Flash 在 Artificial Analysis 的标准化测试中输出速度约 85 tokens/ 秒,首 token 延迟 2.59 秒,端到端响应时间 31.92 秒。
测量方式不同,放出这组数字只是给你们感受一下。
基准测试,谁更猛?
DeepSeek 官方给出的基准测试对比表中,DeepSeek V4.1 Flash 对比的是 GLM 5.3,我把 GLM-5.3-Flash 加上,重新整理出了下面这张表。
基准测试 | V4.1 Flash | GLM-5.3-Flash | GLM 5.3 | Claude Opus 5 |
|---|---|---|---|---|
Terminal-Bench 2.1 | 90.6 | 84.3 | 88.2 | 89.1 |
DeepSWE v1.1 | 74.2 | 63.4 | 66.9 | 74.0 |
Automation-Bench | 54.8 | 48.8 | 46.7 | 50.3 |
Agents' Last Exam | 31.8 | 26.3 | 28.5 | 28.6 |
HLE(含工具) | 63.9 | 55.3 | 62.5 | 63.6 |
CyberGym | 88.1 | 84.5 | ||
GDPVal-AA v2 | 1773 | 1571 | ||
GPQA Diamond | 90.9 | 88.1 | 93.4 |
纯看跑分,DeepSeek V4.1 Flash 略胜一筹。这也是 DeepSeek 敢于用 Flash 替代 Pro 的底气之一吧。
第三方榜单,谁更靠前?
DeepSeek V4.1 Flash 昨天刚发布,很多榜单还没有更新。我挑已经出了成绩的聊聊。
LiveBench 是目前少数没有数据污染问题的 LLM 评测平台,7 个大类 23 项任务,每半年换一批题目。两个 Flash 都已经上榜。
排名 | 模型 | 总分 | Agentic Coding | 每任务成本 |
|---|---|---|---|---|
1 | Claude Fable 5.1 | 83.4 | 66.1 | $1.212 |
3 | GPT-6 Astra | 82.2 | 57.3 | $0.736 |
| 5 | DeepSeek V4.1 Flash | 81.1 | 77.3 | $0.029 |
6 | GPT-5.6 Sol | 81.0 | 56.2 | $0.515 |
16 | DeepSeek V4 Pro | 77.4 | 54.9 | $0.044 |
22 | GLM-5.3 (旗舰) | 76.1 | 60.9 | $0.450 |
| 40 | GLM-5.3-Flash | 71.6 | 56.8 | $0.031 |
我专门擦了擦眼睛,确认没有看错。
DeepSeek V4.1 Flash 总分 81.1,排名第 5,比 GPT-5.6 Sol(81.0)还高 0.1 分。关键它是个 Flash 啊。
Agentic Coding 这一项,V4.1 Flash 77.3 分,全场最高。
GLM-5.3-Flash 总分 71.6,排名比较靠后,总分和 DeepSeek V4.1 Flash 相差近 10 分。
Arena(前 LMSYS Chatbot Arena)今天刚更新了 WebDev 前端编程排行榜,DeepSeek V4.1 Flash 以 1620 得分空降第 14 名。
排名不算太高。
分数 | ||
|---|---|---|
14 | DeepSeek V4.1 Flash | 1620 |
15 | GLM-5.3 | 1613 |
| GLM-5.3-Flash | 1605 | |
20 | DeepSeek V4 Flash | 1582 |
21 | DeepSeek V4 Pro | 1580 |
值得注意的是,DeepSeek V4.1 Flash 比自家 V4 Pro 高了 40 分,比 V4 Flash 高了 38 分。
Flash 这个名字,越来越不「名副其实」了。
DeepSeek V4.1 Flash vs GLM-5.3-Flash,你更看好谁?欢迎评论区讨论一波。


登录后才可以发布评论哦
打开小程序可以发布评论哦