市场资讯 6小时前
DeepSeek V4.1 Flash 硬刚智谱「牛来」,谁才是国模 Flash 之王?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(来源:AI 信息 Gap)

DeepSeek V4 Pro,8 月 13 日正式发布,9 月 14 日即将下线。享年 32 天。

而干掉   V4 Pro   的,正是 DeepSeek 自家刚刚发布的   DeepSeek V4.1 Flash。

「V4.1 Flash   在性能、费用、速度、总用时等各项指标上已全面超越   V4 Pro,9 月 14 日起所有 Pro 的 API 请求将自动切换到 Flash,并按 Flash 的价格计费。」

有意思的是,在   DeepSeek V4.1 Flash   之前,另一个 Flash 国模也曾一度爆火。

8 月 20 日,智谱悄悄在 OpenRouter 和 OpenCode 上线了一个匿名模型,代号   Ox-Alpha,中文名「牛来」。Ox-Alpha   首日就冲上了 OpenRouter 榜首,刷新了平台单日 token 调用量历史纪录,还终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录。8 月 26 日,智谱官宣认领了这头牛,Ox-Alpha   的真身是   GLM-5.3-Flash。

Flash,已经不再是单纯的「小杯」了。

DeepSeek V4.1 Flash   vs   GLM-5.3-Flash

先来总结一波。

DeepSeek V4.1 FlashGLM-5.3-Flash

发布日期

2026-09-10

2026-08-26

总参数量

552B

320B

激活参数

输入 8B / 输出 16B

18B(输入输出对称)

架构

MoE + CED(因果编码 - 解码器)

MoE + 稀疏 / 线性注意力混合

上下文窗口

100 万 tokens

原生多模态

文本 + 图片

文本 + 图片 + 视频 + 文件

预训练数据

45 万亿 tokens

30 万亿 tokens

开源协议

MIT

推理力度调节

连续可调 1-100

三档(low / high / max)

DeepSeek V4.1 Flash   和   GLM-5.3-Flash,太像了。

MoE 架构,100 万 tokens 上下文,原生多模态,MIT 协议开源,连推理力度都同样可调节。

但技术架构不同。DeepSeek V4.1 Flash   走了一条非对称路线,输入端只激活 8B 参数,输出端激活 16B。读比写便宜,专为 Agent 场景设计,因为 Agent 要读大量上下文和工具调用结果,输入量远大于输出量。智谱走的是对称路线,输入输出都激活 18B,总参数从   GLM-5.3   的 753B 砍到了 320B。

GLM-5.3-Flash   的多模态更完整,文件和视频输入都支持。

不同的技术路线

DeepSeek V4.1 Flash   和   GLM-5.3-Flash   本质上都在解决同一个问题,「KV Cache 太贵。」

运行 Agent 时,模型每处理一个 token 都要在显存里存一组缓存数据,上下文越长这笔计算开销越大。Pro 模型的 KV Cache 成本可能比推理计算本身还高。所以,Flash 的核心任务就是尽可能降低这部分算力成本。

DeepSeek V4.1 Flash   采用了一个名为 CED 的新架构,全称 Causal Encoder-Decoder。它把 40 层 Transformer 拆分为上下两部分,前 20 层是编码器,负责读入上下文;后 20 层是解码器,负责生成输出。编码器处理输入时只激活 8B 参数,解码器生成输出时激活 16B。

重点在于如何压缩 KV Cache。解码器的全局缓存直接从编码器最后一层的输出里投影过来,不再自己逐层计算。再加上 FP4 量化和跨层共享索引,每个 token 的全局 KV Cache 从上一代的 3514 字节压缩到了 890 字节。

GLM-5.3-Flash   则走了混合注意力路线。45 层神经网络里,34 层是线性注意力,11 层是稀疏注意力,按三比一的节奏交替排列。

线性注意力用递归机制处理局部依赖,计算量随上下文长度线性增长而不是平方增长,天然适合长上下文。稀疏注意力自带一个轻量索引器,负责从 100 万 token 的全局上下文里精准召回关键信息。

为了进一步压缩成本,智谱还引入了一个叫做 IndexPool 的设计,把索引器的 4 个缓存向量通过加权池化压缩成 1 个。最终,GLM-5.3-Flash   和   GLM-5.3   旗舰版相比,注意力计算量降低了 3 倍,KV Cache 占用降低了 4.4 倍。

技术路线不同,但都是为了省算力。

价格,谁更划算?

DeepSeek 按照峰谷定价,智谱统一价。下面的价格都是人民币。

项目(元 / 百万 token)

V4.1 Flash

(空闲)

V4.1 Flash

(高峰)

GLM-5.3-Flash

缓存命中输入

0.02

0.04

0.23

普通输入

1.0

2.0

0.8

输出

4.0

8.0

2.8

缓存命中,经过这次降价后的   DeepSeek V4.1 Flash   便宜得夸张,闲时 2 分钱,智谱 2 毛 3。缓存命中是 API 调用成本里的大头,这是你最应该关注的部分。

普通输入和输出两项,GLM-5.3-Flash   反而更便宜。普通输入 0.8 元 vs DeepSeek 闲时 1 元,输出 2.8 元 vs 4 元。高峰时段 DeepSeek 翻倍之后差距就更大了,输出价格 2.8 元 vs 8 元。

如果单纯调用 API,DeepSeek V4.1 Flash   大概率更划算。

还有但是。但智谱有 Coding Plan,月付 118 元(Lite)、538 元(Pro)和 1078 元(Max)。DeepSeek 只有按量付费的 API,没有订阅套餐。

Coding Plan 更省心,不用考虑闲时忙时,时不时再来个重置,那就更爽了。

token 速度,谁更快?

速度差异明显,DeepSeek V4.1 Flash   太快了。

根据网友们和我自己的实测数据,DeepSeek V4.1 Flash   的输出速度在 284 到 507 tokens/ 秒之间,最高甚至突破了 500,即使加上思考时间也能维持在 300 左右。

GLM-5.3-Flash   在 Artificial Analysis 的标准化测试中输出速度约 85 tokens/ 秒,首 token 延迟 2.59 秒,端到端响应时间 31.92 秒。

测量方式不同,放出这组数字只是给你们感受一下。

基准测试,谁更猛?

DeepSeek 官方给出的基准测试对比表中,DeepSeek V4.1 Flash   对比的是   GLM 5.3,我把   GLM-5.3-Flash   加上,重新整理出了下面这张表。

基准测试

V4.1 FlashGLM-5.3-FlashGLM 5.3Claude Opus 5

Terminal-Bench 2.1

90.6

84.3

88.2

89.1

DeepSWE v1.1

74.2

63.4

66.9

74.0

Automation-Bench

54.8

48.8

46.7

50.3

Agents' Last Exam

31.8

26.3

28.5

28.6

HLE(含工具)

63.9

55.3

62.5

63.6

CyberGym

88.1

84.5

GDPVal-AA v2

1773

1571

GPQA Diamond

90.9

88.1

93.4

纯看跑分,DeepSeek V4.1 Flash   略胜一筹。这也是 DeepSeek 敢于用 Flash 替代 Pro 的底气之一吧。

第三方榜单,谁更靠前?

DeepSeek V4.1 Flash   昨天刚发布,很多榜单还没有更新。我挑已经出了成绩的聊聊。

LiveBench 是目前少数没有数据污染问题的 LLM 评测平台,7 个大类 23 项任务,每半年换一批题目。两个 Flash 都已经上榜。

排名

模型

总分

Agentic Coding

每任务成本

1

Claude Fable 5.1

83.4

66.1

$1.212

3

GPT-6 Astra

82.2

57.3

$0.736

5DeepSeek V4.1 Flash81.177.3$0.029

6

GPT-5.6 Sol

81.0

56.2

$0.515

16

DeepSeek V4 Pro

77.4

54.9

$0.044

22

GLM-5.3

(旗舰)

76.1

60.9

$0.450

40GLM-5.3-Flash71.656.8$0.031

我专门擦了擦眼睛,确认没有看错。

DeepSeek V4.1 Flash   总分 81.1,排名第 5,比   GPT-5.6 Sol(81.0)还高 0.1 分。关键它是个 Flash 啊。

Agentic Coding 这一项,V4.1 Flash   77.3 分,全场最高。

GLM-5.3-Flash   总分 71.6,排名比较靠后,总分和   DeepSeek V4.1 Flash   相差近 10 分。

Arena(前 LMSYS Chatbot Arena)今天刚更新了 WebDev 前端编程排行榜,DeepSeek V4.1 Flash   以 1620 得分空降第 14 名。

排名不算太高。

分数

14

DeepSeek V4.1 Flash

1620

15

GLM-5.3

1613

GLM-5.3-Flash

1605

20

DeepSeek V4 Flash

1582

21

DeepSeek V4 Pro

1580

值得注意的是,DeepSeek V4.1 Flash   比自家   V4 Pro   高了 40 分,比   V4 Flash   高了 38 分。

Flash 这个名字,越来越不「名副其实」了。

DeepSeek V4.1 Flash   vs   GLM-5.3-Flash,你更看好谁?欢迎评论区讨论一波。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash gap ai mit 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论